ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?

2026/8/23 6:10:38 拓冰建站 浏览量
Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」? 标签AI、大模型、开源模型、自改进、强化学习Ornith-1.5 号称自改进但它真的不是「自己给自己出题自己给自己打满分」8 月 19 日DeepReinforce 团队放出 Ornith-1.5。三个数字让人头皮发麻9B 模型在 SWE-Bench Verified 拿到 70.6接近 Qwen3.6-35B 的 73.4GPQA Diamond 86.4匹敌 Claude Opus 4.8DeepSWE 从上一版的 8.0 跳到 56.0涨了 48 分。但——所有这些数字都是它自己评的。这篇文章不急着下结论先把它到底在干嘛讲清楚把为什么有人觉得它在自欺欺人摆到桌面上。数据对比和实机体验留给后面两篇。一、先看三个数字再决定要不要读下去Ornith-1.5 是 DeepReinforce前身为 DeepReinforce.ai核心研究者来自斯坦福 NLP 组刚放出来的开源模型系列三个尺寸397B MoE、35B MoE、9B Dense。9B 那版6.6GB 就能跑。先看一组让人困惑的对比BenchmarkOrnith-1.5-9BQwen3.6-35B-A3BGemma-4-31BTerminal-Bench 2.147.049.2-SWE-Bench Verified70.673.452.0SWE-Bench Pro47.549.535.7GPQA Diamond86.486.084.3ClawEval66.568.748.5BrowseComp56.462.0-9B 的模型在编码、推理、信息检索上大面积匹敌甚至超过 30B 的模型。这不是小步优化是量级差。再看旗舰版 397B 的成绩Terminal-Bench 2.1 拿到 86.1DeepSWE 拿到 56.0官方说这跟 Claude Opus 4.885.0 / 59.0在一个水平线上。一个 9B 的模型打出这个成绩要么是它真的很强要么是……它给自己出题的时候出了点偏题。这就是本文要追问的核心问题。二、Ornith-1.5 到底做了什么一句话讲清它把训练任务策划这件事从人类手里拿走了交给了模型自己。Ornith-1.02026 年 6 月做到了自脚手架self-scaffolding模型能自己搭建执行框架——工具调用、任务分解、重试策略。但训练任务本身还是人编的。Ornith-1.5 往前走了一步。它的训练循环是一个三段闭环第一阶段自己出题。给定一个代码库或环境、任务类型的大方向、以及自己过去做过的题的历史模型生成一道比它目前能力边界再难一点的新任务。目标成功率设为20%——即大部分时候它做不出来但又有足够成功样本来训练。第二阶段自己搭脚手架。针对这道题模型生成或优化一套专属执行框架指令、工具、分解策略、编排逻辑。第三阶段自己解题。策略网络基于任务脚手架生成解决方案通过 GRPOGroup Relative Policy Optimization强化学习把奖励信号同时回传给三个阶段。这套系统有三重防作弊奖励有效性题目可执行、可验证、前沿难度卡在能力边界附近、新颖性不能跟做过的题太像。听起来很美。但问题也来了——三、那个绕不开的问题它真的不是自欺欺人吗当一个系统既出题、又出题的评分标准、还自己答题——你怎么知道它不是在给自己开卷考试这不是刁难。自评分self-scoring是所有自改进系统共同面对的原罪。OpenAI 说 GPT-5.3-Codex instrumental in creating itself但所有人都清楚这句话意味着什么模型参与了训练管线的某一步不等于它真的在自我进化。Ornith-1.5 的防御机制有三层三重 reward 信号——出题质量、脚手架质量、答案质量分别打分互不相同理论上可以互相制衡20% 目标成功率——不让你只挑能做对的题Anti-hacking 过滤器——SWE-Bench 评测时会移除 Git 历史、断网、限制外部资源访问防止模型作弊但社区质疑的是更深层的东西出题和打分的标准本身仍然是模型自己定义和执行的。一个足够聪明的模型理论上可以学会生成它自己能答对、又通过了有效性检查的题目——这不算完全作弊但也不算真正的难度提升。MIT Technology Review 恰好在 Ornith-1.5 发布前一天发表了一篇对 AI 递归自改进的质疑文章。核心发现是在 NeurIPS 未发表论文上测试的 AI 代理产出的工作nowhere close to the mark。Anthropic 联合创始人 Jack Clark 的评论更直接对短期递归自改进时间表持悲观信号a bearish signal on short recursive self-improvement timelines。Hacker News 上社区对 Ornith-1.0 的吐槽也直接搬过来了——benchmaxxed versions of Qwen or Gemma 4。这话不客气但也不冤枉9B 版本的 backbone 确实是 Qwen 3.5。四、那 48 分的 DeepSWE 怎么解释如果 Ornith-1.5 只是调参调出来的 Qwen 3.5那最大的疑点是——DeepSWE 从 8.0 跳到 56.0这个幅度不合理。DeepSWE 不是那种容易刷分的闭卷测试题。它是真实的软件工程任务代码库、问题描述、补丁要求都是来自真实项目。要在这个评测上从 8 分到 56 分靠 prompt tuning 或微调不可能做到。两种可能性自改进确实起了作用。模型自己出题逼自己解决更难的问题形成了真正的能力螺旋——这就是 Ornith AI 想证明的事。训练管线的变化产生了系统性提升不一定是自改进本身但方向是对的。比如任务生成的多样性比人工策划更丰富或者 GRPO 的联合优化比单目标训练更有效。不管是哪种训练方法确实变了而不是把 Qwen 3.5 重新调了一遍包。五、为什么我还是要关注它理由有三个。第一性价比是真实的。9B、6.6GB、SWE-Bench Verified 70.6、GPQA 86.4——不管数字水分多大能在消费级显卡和手机上跑出这个效果本身就是里程碑。第二自出题训练的思路方向是对的。人类策划训练任务的瓶颈越来越明显数据质量见顶、benchmark 越来越容易被刷、长尾任务没人写。如果模型能自己扩展训练课程这条路再难也值得走。第三MIT 协议 开源权重 你可以自己验证。不像某些模型只能信官方数字Ornith-1.5 的权重、评测脚本、模型卡全都在 HuggingFace 上。这意味着——我可以自己跑一遍。这就是后面两篇要做的事。六、后面两篇干什么第二篇纯数据对比。把 Ornith-1.5-9B 拉到一张表上跟 Ornith-1.0-9B、Qwen3.5-9B、Gemma-4-31B、Qwen3.6-35B-A3B 逐条对比——编码、推理、检索、工具调用哪些真的强、哪些其实被反超了。第三篇实机部署 亲身体验。在本地用 Ollama 跑起来写代码、改 bug、用工具——看看 70.6 的 SWE-Bench 分数在日常开发里到底兑不兑现。三篇走完自改进是真的还是假的这个问题就有答案了。七、一句话Ornith-1.5 最牛的不是它的分数——是它让你无法简单地用又一个刷分模型打发它。48 分的 DeepSWE 提升、9B 打出 35B 的编码分数、全开源 MIT 协议——哪怕它有自评分的硬伤也比大多数号称突破的发布更值得认真看一眼。但它是不是真的自改进我们后面见。本文数据基于 Ornith AI 官方公告ornith.ai/ornith_1_5.html、HuggingFace 模型卡ornith-ai/Ornith-1.5-9B、Ollama 库、Byteiota 及 RuntimeWire 分析整理。Benchmark 数据均为官方自测尚未经独立第三方复现。截稿于 2026-08-20。这是 Ornith-1.5 系列第一篇。下一篇会做纯 Benchmark 横评看看数字背后的真实差距。你觉得自改进这条路走得通吗评论区聊聊。附核心信源事项来源Ornith-1.5 发布及技术细节ornith.ai/ornith_1_5.html9B 完整 Benchmark 数据HuggingFace: ornith-ai/Ornith-1.5-9B模型规格架构/上下文/量化HuggingFace model card、Ollama libraryDeepSWE 48 分分析Byteiota 深度评测社区质疑 / 技术背景RuntimeWire、Hacker News 讨论递归自改进质疑MIT Technology Review2026-08-18 发文Jack Clark 评论Byteiota 引用MIT 许可证 / 开源协议HuggingFace、ornith.ai 官方文档