AI 造 AI,一次只要 2 分钱——这个开源项目凭什么?
AI 造 AI,一次只要 2 分钱——这个开源项目凭什么?
凌晨两点,一个开发者往终端里敲了一句话:
“Collect the docs from https://github.com/ericbuess/claude-code-docs and build a RAG app that answers Claude Code questions as a configuration expert, citing its sources.”
然后他去泡了杯咖啡。回来的时候,一个完整的 RAG 应用已经躺在本地:检索、引用溯源、内置示例问题,全都有。账单显示这次"外包"一共烧了0.02 美元(约 1 毛 4 分人民币)的 token,跑在 DeepSeek V4 Pro 上。
这不是科幻段子,是 PenguinHarness 的 README 里官方演示的第一条。这个项目今天悄悄爬上了 GitHub Trending,1341 颗星,没有发布会,只有一句口号:Let AI Build AI。
一个"造 Agent 的 Agent"
先说作者。PenguinHarness 背后是 Yaowei Zheng(hiyouga),开源圈熟脸——他的上一个项目 LLaMA-Factory 是微调界的事实标准之一。做微调工具的人,现在跑来写 Agent 框架,这个信号本身就值得琢磨。
官方对标对象是 LangChain。README 里有一句很损的话:
用 LangChain,你亲手搭 Agent,速度是 1×;用 PenguinHarness,Agent 造 Agent,速度是 100×。
项目名里的 RSI 也是个梗——Repetitive Strain Injury,重复性劳损。天天手搓 Agent 骨架搓到腱鞘炎,不如让 Agent 自己生自己。
2 分钱的底气从哪来
省钱的秘密不在模型,在工具集。PenguinHarness 走的是"极简工具 + 干净的低层接口"路线:工具调用次数更少,token 消耗更少,而且明确针对 DeepSeek 这类开源模型做过调优。
官方基准图显示(benchmark 数据):数据分析准确率全场最高,成本是 Claude Code 的 1/70;代码任务和 OpenAI Codex 打平,成本同样低一个数量级。
这个账算下来很吓人。之前我们讨论"Agent 贵不贵",前提是 Agent 由人指挥;现在 Agent 由 Agent 指挥,成本基数直接砍两三个零,跑"自进化"循环才变得现实。
自己跑分、自己找茬、自己升级
PenguinHarness 最值得深挖的设计,是内置的自进化闭环(Skills 机制,见 官方文档):
- 跑一轮 benchmark,找出丢分点
- 针对丢分点做优化,生成 N+1 版
- 每轮开始前自动打快照,所有请求都能在 Trace 视图里回放
翻译成人话:Agent 不再是被动执行指令的工具,而是一个会自己"刷题、复盘、迭代"的实习生。内置的 16 个 Skill 分四组——办公、软件开发、AI 应用开发、Agent 调优,其中agent-creation、benchmark-design、agent-evaluation、agent-optimization这一组,就是专门给"Agent 自己改进自己"用的。
下一步:Agent 开公司?
跑分省钱、自进化闭环,这两件事叠在一起,指向一个更大的想象空间——Roadmap 里写着两个词:Agent company(Agent 公司)和company-level self evolving(公司级自进化)。
也就是说,作者想做的不是"一个更好用的 Agent 框架",而是"一群 Agent 组成一家公司,自己招自己、自己考核自己"。这比单纯卷 benchmark 数字的框架有意思得多。
我的判断:2026 年下半年的竞争主线已经从"模型跑分"转移到"Agent 生产 Agent 的效率"。PenguinHarness 用 2 分钱证明了一个事实——造 Agent 的成本正在逼近零,稀缺的不再是工具,而是你会不会给 AI 派活。
主要参考:PenguinHarness on GitHub | LLaMA-Factory | Product Hunt 页面 | GitHub Trending