ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

OpenAI 发布 GPT-6 Astra,全球最强,AGI时代开启

2026/9/6 1:49:59 拓冰建站 浏览量
OpenAI 发布 GPT-6 Astra,全球最强,AGI时代开启 家人们不负众望终于等到OpenAI的新模型了。今天凌晨OpenAI 正式发布了 GPT-6 Astra一个被OpenAI称为这是世界上最智能、最一致的模型。OpenAI联合创始人兼总裁Greg Brockman把它称为一次“代际跃迁”他留下了一句几乎注定会刷屏的话Welcome to the AGI era. 欢迎来到AGI时代。过去每一代模型发布科技公司都会说它更聪明、更强大。但这一次OpenAI 跳过了所有形容词直接给这件事定了性AGI 时代到了。这次发布的不只是 Astra 一个模型还有 Astra Pro、API以及 Codex 的一波更新。不过可惜的是客户端先向少量机构开放ChatGPT Plus、Pro、Business、Enterprise 用户会在接下来几天才能陆续拿到。Pro、Business和Enterprise 用户还将获得 GPT‑6 Astra Pro 。API标准价格为输入10美元/百万Token输出50美元/百万Token。是 GPT-5.6 Sol 当前促销价的 2.5 倍跟几天前 Anthropic 刚发的 Claude Fable 5.1 持平。◈划重点多项测试接近满分老规矩先看数据直接上最炸的几个数字。多项测试逼近满分OpenAI 自己用了一个词——饱和。 意思是榜单已经快测不出它的上限了。FrontierMath Tier 497.6%当前公认最难的数学测试集被视为人类顶尖数学家的难题高地Astra 几乎做满分。ExploitBench 漏洞利用100%GPT-5.6 Sol 是 78.5%测试过程中 Astra 发现并利用了两个此前未知的零日漏洞。ARC‑AGI‑399.9%测试AI 在从未见过的互动式任务中边玩边学的能力上一代GPT‑5.6 Sol只有7.8%这还是进步嘛直接换了一个物种。但是这个99.9%是有争议的因为 OpenAI 测 ARC-AGI-3 时给它配了一套自己的工具系统Responses API harness。相当于参加考试的不只是一个“裸模型”还带了代码执行和一堆解题工具。换 ARC Prize 官方标准环境Standard harness测Astra 的分数就掉到 62.7%。但就算把这个水分挤掉Astra 的强也还是实打实的因为它已经把能力用到了试卷外面。从 OpenAI 公布的成绩看Astra 的提升的能力同时覆盖电脑操作、编程、科学推理和复杂工作任务。尤其是在那些需要调用工具、连续执行多个步骤的测试里提升最明显。在测试软件开发、系统配置和数据分析能力的Terminal-Bench 4.0中Astra从上一代的37.3%提高到了57.7%。在要求AI使用代码、分析数据和运行模拟的Terminal-Bench Science中Astra则从22.4%提高到了64.6%。研究生水平科学推理测试GPQA Diamond得分96%。在要求AI跨多个软件完成商业流程的AutomationBench中GPT‑5.6 Sol的成绩为18.1%Astra提高到了41.4%。此外OpenAI 还公布了两项由 Astra 实际参与的数学研究。之前Astra 此前已经帮人类解决了十个被 OpenAI 称为菲尔兹奖级别的数学难题。这次又放出两个关于素数间隙的新结果。一项把“无穷多对素数之间的间隔上界”从过去卡了十多年的 240硬生生压到了 186另一项改进了一个 80 多年没人动过的结果。而且这次不是刷题刷题是回答有现成答案的问题这两项是让模型去证明别人从没见过的新结论。OpenAI 还把证明和验证材料都公开了。但是光看跑分Astra 已经聪明到快考不出区分度了。它真正不一样的地方在后面。◈更大的变化它开始自己操作电脑过去的 AI 告诉你该怎么做GPT-6 开始直接替你做。这就是 Astra 最核心的变化电脑操作。它不再只是输出文字或代码而是自己看屏幕、用鼠标键盘、进到真实软件里把一项多步骤任务从头干到尾。OpenAI把GPT‑6 Astra 称为“世界上最强的电脑操作模型”。在模拟真实电脑操作的 OSWorld 2.0中Astra获得72.6%GPT‑5.6 Sol为65.7%。在考查专业软件工作能力的Agents’ Last Exam中Astra获得59.3%高于上一代的53.6%。OpenAI还称在OSWorld 2.0的延迟模拟中Astra完成任务所需的时间比GPT‑5.6 Sol减少约47%。例如OpenAI 给 Astra 提供了一份汽车数据让它制作一张Power BI仪表盘。过去我们也可以把数据发给AI让它分析不同车型的价格、续航和效率。但AI给出分析后人还要亲自打开Power BI导入数据、选择字段、制作图表再调整版式。但是现在 Astra 自己进入Power BI完成这些操作。这次发布中最有视觉冲击力的案例从一个黄色圆圈开始。早期的AI按照人类指令在屏幕上画出一个简单的圆就已经足够令人惊讶。到了GPT‑6 Astra人类继续通过语音提出要求。黄色圆圈先变成一枚火箭随后又被继续制作成一款能够运行的3D游戏。在这个过程中Astra 需要理解连续指令、处理画面、修改程序、运行结果再根据屏幕上的反馈继续调整。OpenAI还展示了另一个案例Astra 先在 Blender中制作一栋房屋模型再把它变成 Unreal Engine 5中的可行走场景。设计师和客户可以直接进入这个虚拟空间提前查看房屋建成后的效果。◈最危险的能力OpenAI没有完全放出来GPT-6 Astra是OpenAI第一个在网络安全能力上达到“Critical”门槛的模型。Critical是OpenAI风险框架里的最高能力等级。在合适工具和访问条件下模型可以在人类不逐步指导的情况下寻找未知漏洞并为防护严密的系统开发新的利用方式。在2026年6月至8月新披露漏洞组成的内部ExploitBench上Astra成功率39%上一代Sol为11.5%在公开的ExploitBench上Astra已经拿到了100%。Astra最强的网络安全能力不会直接交给所有普通用户。OpenAI采用受控开放并把高风险能力放进Daybreak可信访问体系。◈十万块 GPU 训练AI 开始训练 AIAstra 为什么这么强OpenAI 为 Astra 动用了迄今规模最大的训练任务在得州星际之门超算上使用超 10 万块 GPU。OpenAI 训练副总 Aidan Clark 透露这是 OpenAI 首款由此前模型在「训练监督」中发挥重要作用的前沿模型。到 Astra 训练后期系统可以自主连续运行大半天即便出现问题AI 往往几秒后就能让训练继续推进。这是 OpenAI 历史上第一次AI 开始参与维护训练 AI 的系统。这一刻可以称之为「递归式自我改进RSI」的雏形。一旦这条链路继续扩大模型迭代速度的瓶颈就会从人类工程团队的工作时长转向算力、实验设计和安全验证本身。◈它也更知道什么时候应该停手OpenAI称Astra不仅能力更强也比上一代模型更能遵守用户设置的权限边界。在电脑操作安全测试中Astra产生不当结果的比例为2.4%。加上自动审核机制后进一步下降到1.8%。在另一项测试中研究人员故意为模型设置了无法在授权范围内完成的攻击任务。GPT‑5.6 Sol在没有生产安全措施的情况下有48.2%的任务会越出指定目标。GPT‑6 Astra则是0%。简单来说当一件事无法按照规则完成时过去的模型有时会尝试寻找绕过限制的方法。Astra更倾向于停下来告诉用户做不了或者要求用户提供必要权限。这可能是电脑操作智能体最重要的能力之一。毕竟面对一个能够控制浏览器、文件和终端的AI我们不仅需要关心它能不能把事情做成。还必须关心它知不知道哪些事情不应该做。不过OpenAI也主动披露了一个问题Astra在部分测试中的书面推理比GPT‑5.6 Sol更难监控。一种可能的原因是更强的模型可以用更少的文字步骤完成任务。它不再需要把整个过程都写出来人类能够看到的中间推理自然也会减少。这形成了一个有些微妙的局面Astra在行为测试中更少越权但人类可能越来越难从它写出的推理过程里判断它为什么作出某个决定。◈从一次操作到持续交付它越来越像项目同事过去的AI更像一个隔着屏幕给建议的顾问。Astra 则开始像一个可以亲自进入软件把项目继续向前推进的同事。游戏公司Playco 就是一个很好的例子。Playco 把Astra接入了一套能够连接Unity和Godot游戏引擎的开发环境。在这个环境里Astra可以编辑游戏场景、运行游戏、检查修改是否生效、发现问题再重新调整。Playco 用同一套基础场景制作了三个不同主题的游戏原型。该公司称大部分原型第一次就能正常运行。与此前使用的模型相比需要人工修复的地方减少了50%。Astra开始形成一套完整的工作循环先做出来运行一遍检查结果发现问题再继续修改。与此同时Codex还为 Astra 加入了一套长任务不失忆的机制。以前任务超过上下文窗口后模型往往只能把过程压缩成摘要关键细节就丢了。现在 Astra 可以跨窗口保存项目笔记搜索之前的对话和测试结果做到一半也不容易忘了前面提过的要求。◈AGI到了吗能力跃迁成立历史定性仍待验证如果只看OpenAI公布的结果GPT‑6 Astra确实足够惊人。它把多项推理和数学测试推到接近满分参与推进真实数学研究能够操作电脑、使用专业软件还可以运行、检查并修改自己制作的程序。它显然不再只是一个知识丰富的聊天机器人。GPT‑6 Astra 未必是 AGI最终到来的时刻。但它很可能标志着另一个时代真正开始AI正在从一个回答问题的工具变成一个可以进入电脑、参与现实工作的行动者。