ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

little-coder完整指南:为什么9.7B的本地小模型能赢过前沿模型的编程Agent

2026/10/3 17:02:21 拓冰建站 浏览量
little-coder完整指南:为什么9.7B的本地小模型能赢过前沿模型的编程Agent little-coder完整指南为什么9.7B的本地小模型能赢过前沿模型的编程Agent【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder是一个为本地小模型深度调优的开源编程 Agentcoding agent。它让一台 8GB 显存的消费级笔记本跑 9.7B 的 Qwen3.5 小模型在 Aider Polyglot 基准上拿到45.6%的通过率——略胜前沿模型 GPT-4.5-preview 的 44.9%更是同一模型配合主流脚手架 Aider 时19.1%的2.4 倍。全部推理离线完成不花一分钱 API 费用。数据来自两次完整 225 题运行46.22% / 44.89%的均值基线与逐题明细见 docs/benchmark-reproduction.md。为什么是脚手架而不是更大的模型关键实验设计保持模型权重、上下文预算、测试协议完全一致只换 Agent 脚手架。结果如下docs/benchmark-baseline-aider.md系统模型通过率little-coderQwen3.5 9.7B本地45.6%vanilla AiderQwen3.5 9.7B本地19.11%GPT-4.5-preview Aider前沿大模型44.9%换脚手架带来26.5 个百分点的差距。更硬的证据是把 225 道题按两套系统的结果交叉分类69 题只有 little-coder 做对模型明明有能力是 Aider 的整文件重写架构没接住只有 11 题反向成立——脚手架净贡献约58~61 道题。也就是说小模型的弱很多不是参数量的问题而是脚手架放大了它的坏习惯。六个语言赛道全部领先Python 差距最大-35ppRust 差距最小——因为 Rust 的借用检查器是纯模型能力天花板脚手架搬不动。little-coder 是什么pi 30个扩展 30张技能卡little-coder 本身不重写 Agent 内核。它是pi一个极简 Agent 运行时 30 多个扩展 30 个技能 markdown 文件 一套 Python 基准测试框架。pi 提供 Agent 循环、多供应商 API、TUI 和扩展模型little-coder 的小模型适配全部以独立扩展形式挂在 pi 的生命周期钩子上。冷启动上下文只有约 7k token完整加载的 Agent 通常 20k。对 8GB 显存的本地推理来说开局省下的每一个 token 都是真金白银。架构与文档入口项目说明README.md系统提示词项目规范AGENTS.md扩展机制docs/extensions.md模型注册表models.json4个关键设计小模型编程Agent的防身术1. Write 守卫从机制上禁止整文件重写小模型最常见的坏习惯是把整个文件重写一遍顺手毁掉能过的测试。little-coder 的Write工具在已有文件上直接拒绝并返回一条结构化错误指回正确的Edit调用形态。这不是提示词层面的请求而是运行时不变量。基准数据平均57% 的练习会触发该拦截Go 最高 67%C 最低 25%Edit 与 Write 调用比稳定在7.3:1。没有这道护栏这 143 次 Write 尝试就是 143 次整文件覆写的机会。2. 按需注入技能卡 算法小抄小模型记不住 30 张工具用法卡。little-coder 每轮只挑 1~2 张注入约 300 token优先级为错误恢复 近期使用 意图预测——上一个工具调用失败了就优先补那张工具的使用说明。算法小抄则按关键词二元组打分触发阈值 2.0。整套技能文件是纯 markdown人类可读可改工具使用卡skills/tools/算法速查表skills/knowledge/研究/引用/任务分解协议skills/protocols/3. 思考预算上限推理 2048 token 封顶但思路能复用小模型容易陷入想了 2 万 token 还没写出代码的死循环。思考流被实时监控超过 2048 token 立即截断已产生的部分推理会重新注入上下文然后关闭思考重试。每次运行触发约 200 次——接近每题一次。没有这道闸要么上下文耗尽要么思考挤占了实现 token。4. 输出修复 质量监控本地小模型经常吐出畸形的工具调用裸 JSON、尾逗号、被截断的块。output-parser负责修复quality-monitor负责抓住三种退化行为——空响应、幻觉工具名、同参死循环同一调用 3 次以上避免 Agent 无限打转。重试机制值 8 个百分点首次尝试失败后little-coder 会把测试输出喂回上下文给第二次机会。数据docs/benchmark-reproduction.md总通过率45.6%去掉重试后只剩37.6%——重试机制净贡献8.0ppC 收益最大13.5ppAgent 常写出只差一个边界情况的 C靠测试输出精准修复约82%的通过发生在首次尝试说明主体能力来自前面的四个设计重试是兜底保险。时间成本慢一点但每小时产出更高little-coder 平均每题 14~20 轮工具调用读→改→跑测试→再改失败题会耗掉几乎全部 20 轮预算19.0 轮通过题平均 11.6 轮就收敛。结果是单题耗时更长失败题 491s vs Aider 224s但每小时通过数 4.74 vs 2.75吞吐仍高 72%——脚手架的开销被更多的胜利覆盖了。快速上手三步装上你的本地编程AgentStep 1 — 安装Node.js ≥ 22.19一行命令npm install -g little-coder # 或curl -fsSL https://raw.githubusercontent.com/itayinbarr/little-coder/main/install.sh | bashStep 2 — 起一个本地模型服务任选其一见 README.md 的 Local model setup 一节Ollama最简ollama pull qwen3.5论文同款 9.7Bllama.cpp最快支持 MoE构建后以--n-cpu-moe 999运行专家权重放内存、注意力放 GPU22GB 的 Qwen3.6-35B-A3B 也能跑进 8GB 显存LM StudioGUI 启动本地服务器即可本地服务仍需设置一个占位 API key例如export OLLAMA_API_KEYnoopStep 3 — 启动cd ~/your-project little-coder # 默认模型models.json 中声明 little-coder --model ollama/qwen3.5 # 或显式指定 little-coder --list-models # 查看可用模型模型与服务的对应关系在 models.json 中注册想改默认模型、加社区微调模型放一个用户级覆盖文件到~/.config/little-coder/models.json即可升级不会被冲掉。常用交互ctrlq切换计划模式、f2触发 Deep Research、dispatch派子 Agent 做只读调研、ShellStart把长任务丢到后台按事件唤醒。想复现基准数据需要源码benchmarks/不随 npm 包发布git clone https://gitcode.com/gh_mirrors/li/little-coder cd little-coder python3 benchmarks/aider_polyglot.py # 基准测试驱动见 benchmarks/aider_polyglot.py进阶扩展你的小模型Agent自己的扩展丢进~/.config/little-coder/extensions/下次启动自动加载/extensions查看加载状态扩展就是钩住 pi 生命周期事件的 TypeScript 模块官方扩展源码就是最好的参考完整指南docs/extensions.md想要 Zed 集成docs/zed-acp.md所有针对小模型的扩展对云端大模型自动失效不会互相干扰——同一个 little-coder 既能伺候 9.7B 本地模型也能接 Claude/GPT。常见问题Q9.7B 真能超过前沿模型吗AAider Polyglot225 道单文件算法编程题上可以45.6% vs 44.9%。但换到多文件真实仓库任务SWE-bench 类差距会重现——这个基准更考验按规范写代码 跑测试的流程恰好是小模型在好脚手架下的强项。后续 35B-A3B MoE 本地模型把同基准拉到了78.67%docs/benchmark-qwen3.6-35b-a3b.md。Q没有 GPU 能用吗A可以。Ollama / LM Studio / llama.cpp 都支持纯 CPU速度慢一些little-coder 的 20 轮上限和上下文预算保证任务会正常收敛而非无限挂起。Q它和 Aider 的分工是什么AAider 是整文件重写式脚手架little-coder 是工具调用 护栏式 Agent。本项目最有价值的产出恰恰是用同模型对照实验证明了对小模型而言脚手架架构值 26 个百分点。小结little-coder 证明了一条反直觉的路小模型编程 Agent 的瓶颈往往不在参数量而在脚手架。Write 守卫、按需技能注入、思考预算、输出修复——四道防身术把 9.7B 本地模型从 19% 抬到 45.6%在 Aider Polyglot 上追平并略胜前沿模型。而且它免费、离线、装在一行命令里。如果你的笔记本显存只有 8GB这套开源小模型编程 Agent 值得一试。✅【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考