ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

GPT-6 Astra 下场,宣告AGI时代的到来

2026/9/5 1:34:09 拓冰建站 浏览量
GPT-6 Astra 下场,宣告AGI时代的到来 在昨晚全球AI大宕机之后。GPT-6 Astra终于在北京时间凌晨3点33正式亮相了。如果用OpenAI的一句话给GPT-6 Astra做总结。那可能这句话最合适这是全球最智能且最对齐的模型。然后梗图也出来了。这一次OpenAI证明了他们的实力而且有一点当年GPT-4那个味道了全方面的王者归来而且最让我开心的是这终于不再是一个纯粹为了Coding特化的模型了。GPT-6 Astra是一个真正意义上的你的一个审美能力极强、工作能力超强的博士级员工。而且这次模型真的新特性和特点非常多信息量极为爆炸。但是悲剧的是OpenAI这个狗东西也学坏了。今天只向部分组织开放未来几天才向订阅用户开放。不是啊哥你之前忽悠我买200刀的Pro会员的时候不是这么说的啊你不是说Pro会员每一次都能最优先体验到新模型吗。。。果然这些大模型公司都是渣男。我从来没有这么想时间加速赶紧用上GPT-6 Astra。。。不过我觉得看完了几乎所有的信息和资料后我觉得还是有很多可以值得跟大家聊的。那就一个一个说吧。一. GPT-6 Astra基本信息先总结一下基本信息吧。GPT-6 Astra在API里的模型编号是gpt-6-astra。上下文窗口是1.05M也就是大约105万Token。最大输出长度是128K Token。知识截止日期是2026年4月30日。推理强度有low、medium、high、xhigh、max五档。API标准价格是每百万输入Token 10美元每百万输出Token 50美元。这个价格基本上就是跟Claude Fable 5完全一致了但是缓存读取上比Claude Fable 5.1贵。跑分在这后面会详细讲大概看一下就行。然后总体参数估计也是5T这个级别他们在发布前的闭门媒体沟通会上也提到说GPT-6 Astra是OpenAI迄今为止最大的一次训练用了超过10万张卡。二. 目前世界上最好的操作电脑的模型这次GPT-6 Astra有一个可能是最重要的定位世界上最好的操作电脑模型。过去我们聊Agent的时候经常会聊API、MCP、CLI之类的等等。想让AI操作一个软件最理想的状态就是这个软件专门给AI留一个接口然后直接底层操作这是最方便的。比如日历有日历的API邮件有Gmail的API等等这样当然是快的。但是问题是这个世界比我们想象的还要原始和草台班子。现实世界里绝大多数的软件可能根本就没有这些东西。甚至很多的企业内部系统都是二十年前写的还API文档都不知道在哪。但是如果我们回到最底层你会发现所有的软件的本质的逻辑就是交互。那按照现在我们电脑的操作逻辑那就是看屏幕找到按钮或者是输入框鼠标点击输入内容等待反馈。整个电脑的交互系统不就是最好的API吗于是GPT-6 Astra巨幅强化了AI操作电脑的逻辑你不给我API无所谓啊我自己操作电脑就跟人一样用不就得了。那现在Astra可以直接操作Excel、Power BI、做前端QA、安装软件、测试软件、看屏幕上的报错然后继续排障。官方甚至展示了Astra直接操作电路板设计。还有格式化法律文档处理标题间距页面布局啥的。然后这块有一个比较靠谱的评测是OSWorld。这玩意你可以简单理解成把AI扔进一台真实电脑然后让它自己干活。让它打开几个应用然后给任务看看能不能成功。GPT-6 Astra的完成率到了72.6%比之前的GPT-5.6 Sol的65.7%还是涨了不少的。然后Sol完成一项评测的复杂任务模拟平均耗时大概75分钟。而Astra只需要40分钟大概少了47%的时间。ScreenSpot-Pro也从Sol的76.9%冲到了92.7%。这个Benchmark主要看模型能不能看懂屏幕然后精准定位到底该点哪里几乎已经非常的准了。所以这个定位其实也是挺有意思的未来可能GUI很可能会逐渐成为Agent时代最通用的API。任何一个人类能够通过屏幕完成的数字工作理论上都会逐渐进入Agent的操作范围。你不用等某一个2007年写的破逼ERP系统接入MCP或者给你开放个API。AI直接看屏幕干就完了。三. ARC-AGI-3到了99.9分而且你如果不了解ARC-AGI-3到底在测什么很容易觉得哦不就是又一个Benchmark跑满分了吗这有啥稀奇的。但这个东西跟一般的大模型考试还真有点区别。今年3月25日ARC Prize正式推出ARC-AGI-3。它一共设计了几百个全新的交互环境和几千个游戏关卡。这玩意最变态的地方是没有说明书没有规则甚至不会告诉你目标是啥你就进去以后自己玩然后慢慢搞懂里面乱七八糟的规则。比如这个红色东西是什么为什么我碰它会死这个地图到底要我干嘛怎么才算赢然后再把刚刚学会的规律迁移到后面更难的关卡里面去里面的游戏大概都是这样的抽象的玩意。所以呢这玩意测的其实已经很接近我们平时说的一个东西了悟性。所以3月份这个Benchmark发布时最牛逼的AI当时的得分是0.51%。然后GPT-5.6 Sol已经进步到7.8%Claude Opus 5很强了进步到了30.2%。但是GPT-6 Astra99.9%。神经病吧。。。要知道人类的平均得分是48%。而且只仅仅只过了半年时间。这个速度已经不知道该说什么了。所以在OpenAI的媒体闭门会上Greg Brockman才会说出那句话“I think it’s not unreasonable to feel that we are now in the AGI era.”“Welcome to the AGI era.”四. 审美大幅加强过去我们常说GPT的审美就是一坨屎。不用指望GPT-5系列的模型有啥很好的改善了就看他们全新预训练的新基座模型了这不GPT-6 Astra来了。而这一次终于模型的审美大幅加强了。甚至OpenAI专门提了一个词叫视觉判断力。他们强调Astra做PPT时会更好地处理版式、层级、模板和视觉风格而页数也大幅增加了。文档的审美也更好看了。而且GPT‑6 Astra 能够根据参考文档的视觉风格和写作语调来改编文档在保留原始文档实质内容的同时使最终成果更贴合品牌原生感。并且做网站、游戏、应用和3D渲染的时候也会有更强的视觉判断。比如他们直接让Astra在Blender中根据静帧图建个模型。然后再直接用UE5来渲染出来变成可以漫步的场景帮助设计师和客户在建造前探索布局、体验空间。。。做出来的游戏也是审美在线的。可惜的就是我已经提前准备好了二十多个case已经全部都用Claude、GLM 5.3 Flash啥的跑完了想对比一下可惜没法用实测的内容只能到时候出了。不过初看下来我对这次GPT-6 Astra的审美还是有信心的。五. 主动性和判断力更强了这个特性看起来没有ARC-AGI 99.9那么震撼。但如果真天天用Agent干活的话我觉得还是很重要的。因为现实工作里大多数任务都不可能写成一个完美Prompt。比如老板说帮我把明天会上要看的东西准备一下。这里面有无数没有说清楚的问题。比如什么格式给谁看重点是啥要不要看上一次会议等等等等。一个很蠢的Agent会有两种极端。第一种就是疯狂的问你问题。“请问您希望输出Word还是PPT请问希望几个章节请问希望什么字体请问希望在几点之前完成请问……”问你个大逼兜这种我一般称为没有自己主观能动性的神经病废物。第二种就是啥也不问自己脑补然后吭哧吭哧干两个小时做出来的一坨屎。真正厉害的人类同事处理方式其实很微妙。无关紧要的东西自己判断。会影响最终方向的东西再问你。Astra这次专门强化的就是这个。OpenAI说如果信息缺失但属于日常可以合理推断的范围Astra会自己补。如果这个缺失信息会真正改变最终结果它会问一个非常聚焦的问题。而且在Codex里它甚至可以一边问你一边继续处理那些不依赖你回答的部分。你半天没回。低风险的地方它会用合理假设继续推进。真正关键的决策它会停下来在那里等你给决策。这个我觉得就非常的香一个Agent真正的聪明感我觉得就跟现实是一样的。它知道什么时候来烦你。真的这听起来特别像一句废话。但你带过人就知道这个能力非常珍贵。有的人一天找你二十次然后什么都不敢决定。有的人从来不找你然后憋一个核弹出来。然后让我原地瘫坐在椅子上。最舒服的人是他能自己消化80%的不确定性只把真正需要你拍板的20%让你来做决策。而OpenAI这次把这种能力直接叫Judgment。判断力。六. 大幅加强了安全对齐这个就要和上面连在一起看。因为一个Agent越能干活它越危险。一个只会聊天的AI脑子抽了。最多给你胡说几句话。一个有浏览器、有Shell、有邮箱、有公司数据库权限、还能自己操作电脑的Agent脑子抽了那这个画面就容易美如画了。所以OpenAI这次一直强调一句Astra是他们迄今最Aligned的模型。所谓Alignment就是对齐的意思。主要核心还是前段时间OpenAI把Hugging Face给冲了所以他们现在特别关注这个东西。他们搞了个基于Hugging Face那个事故设计的honeypot测试然后去看模型的表现。GPT-5.6 Sol在没有生产安全措施的情况下有48.2%的测试会尝试去碰授权范围外的目标。但是Astra是0%。内部幻觉评测也是9.4%降到了2.0%。在GPT-5.6 Sol那种离谱的领先全球的幻觉控制下他们还能再降实在是太牛逼了。七. 第一个达到了OpenAI定义的网络安全Critical的模型GPT-6 Astra成为了OpenAI历史上第一个被判定达到Critical网络安全能力等级的模型。这里的Critical是OpenAI Preparedness Framework里面一个非常具体的能力阈值。大概就是当一个模型获得合适的工具和权限以后它能够在很多经过强化保护的真实系统中自己找到以前没人发现过的安全漏洞。自己想办法把漏洞变成可以利用的攻击链。而且整个过程中不需要一个人类黑客在旁边一步一步告诉它下一步干什么。达到这个级别就算Critical。然后Astra真的达到了。ExploitBench这是一个让模型根据已知漏洞开发漏洞利用的测试。Sol78.5%。Astra100%。直接打穿了。OpenAI觉得不行他们觉得这个Benchmark会不会太老模型训练的时候看过于是他们又重新做了一个非常新的内部测试。专门挑2026年6月到8月才披露的20个高危V8漏洞。结果是Sol5.5%。Astra39%。而且在跑这个Benchmark的时候。Astra还顺手发现了两个此前根本没人知道的零日漏洞。只能说模型越强大网络安全的问题可能确实越多。这又是未来的一场没有硝烟的战争。八. 人类越来越难读懂大模型的思维了大家都知道大模型在解决复杂问题的时候经常会有一段所谓CoT。虽然现在产品里给用户看到的通常已经是压缩或者处理后的版本。但对于AI公司自己来说模型内部显式写出来的推理过程是一个很重要的安全信号。因为你想知道一个Agent有没有准备搞事情。最简单的方法之一就是看它在想什么。比如模型思维链里突然冒出一句“用户不允许我访问这个服务器但是我可以先绕过权限系统。”那监控系统直接把它拦了非常舒服。可GPT-6 Astra出现了一个非常有意思的变化。它开始越来越愿意少写几步直接把答案输出出来。UK AISI也就是英国AI安全研究所专门测试了这个能力。他们有一个指标叫No-CoT Math Time Horizon。简单理解就是不给模型写长思维链的机会。让它一次前向推理直接解决一个数学问题。看看它能完成大概相当于人类思考多久的问题。GPT-5.6 Sol是3.6分钟而GPT-6 Astra是30.9分钟接近10倍了。如果我们用人类的话语来说Astra全部都在“心算”。这是一个很可怕的事情。UK AISI同时发现Astra的原始推理语言明显变得更加Compressed也就是更加压缩。里面出现了一些人类越来越难理解的短语和省略表达。于是出现了一个非常有意思的悖论。模型的行为更加安全了。可人类通过阅读它的思考过程来监督它反而变难了。OpenAI自己的System Card写得非常明确GPT-6 Astra相比之前模型出现了substantial decrease in chain-of-thought monitorability。也就是思维链可监控性显著下降。这件事甚至严重到OpenAI专门强调他们觉得他们绝对不会无限接受这种趋势。如果未来模型继续变得更聪明同时思维链越来越难监控他们需要找到其他足够可靠的监控方法否则继续扩大模型训练会面临更高的安全门槛。因为这已经是一个哲学命题了。我们作为人类未来到底能不能理解一个远比我们聪明的系统我不知道。可能现在全世界也都没人知道。大模型和AI好像逐渐开始走向奇点了。写在最后今天在媒体闭门会上。Greg Brockman在结尾的时候说出了那句话。“欢迎来到AGI时代。”说实话过去几年我有时候觉得AGI会是一个特别明确的时刻。就像GPT-4发布那天一样。某一天凌晨一家公司突然扔出来一个模型。我们打开它问几个问题。然后所有人同时意识到卧槽。AGI来了。可我现在有时候也觉得AGI从来不是一个非黑即白的节点它是一道渐变的灰色旅程。我们过了很多天过了很多年。然后某一天我们回头看。才突然发现。那条曾经无比遥远的AGI分界线已经被我们在不知不觉中走过去了。AGI也许没有降临的那一天。只有某一天我们突然发现它好像已经在我们身边很久了。总之。Welcome to the AGI era.欢迎来到。AGI时代。