ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!

2026/9/5 3:17:34 拓冰建站 浏览量
刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来! 大家好我是程序员鱼皮。时间过得真快啊距离 GPT-5 发布竟然已经过去一年多了。昨天凌晨 3 点多OpenAI 终于把 GPT-6 Astra 放出来了官方把它叫做「全世界最智能、也最对齐的模型」。而 OpenAI 总裁 Greg Brockman 在发布前的媒体闭门会上最后说了这么一句话。现在觉得我们已经进入 AGI 时代并不算什么不合理的想法欢迎来到 AGI 时代。我本来是想第一时间跑一轮实测的案例都准备好了。结果打开 ChatGPT 翻了一圈模型列表没有去看 API也没有……去官方博客看了一下目前 Astra 只开放给一小批安全厂商普通订阅用户是用不了的接下来几天才会陆续开给 ChatGPT 的 Plus、Pro、Business 和 Enterprise 用户。吊大家的胃口嘛这不是OpenAI 自己也知道这件事说不过去于是负责 ChatGPT 的 Tibo 发了一条推特说会给每一个订阅了付费计划但还没拿到 Astra 权限的用户按天补偿额度重置一天没用上就补一次。行行行原谅你了正好周五我可以摸鱼了~GPT-6 Astra 强在哪这次OpenAI 官方推文并没有吹 GPT-6 的编程能力而是操作电脑能力。他们把 GPT-6 Astra 称为「全世界最强的电脑操作模型」AI 可以像人一样看屏幕、点按钮、填表单、刷应用无所不能。先看看跑分有个叫 ScreenSpot-Pro 的测试专门考模型能不能看懂屏幕、并且精准点到该点的位置上一代 GPT-5.6 Sol 是 76.9%Astra 直接干到了 92.7%。还有一个更接近真实工作的测试叫 OSWorld就是把 AI 扔进一台真电脑里让它自己干活。Astra 的完成率是 72.6%比 Sol 的 65.7% 高了不少。更关键的是完成同样的任务Sol 平均要 75 分钟Astra 只要 40 分钟我觉得主攻「屏幕理解」是个正确的方向。现实里绝大多数软件根本没有 API很多公司的内部系统还是二十年前写的文档都不知道在哪。但所有软件都有界面那界面本身就是最通用的 APIAI 不用等谁来适配自己看屏幕操作就完了。GPT-6 Astra 的编程能力也有大幅提升。Terminal-Bench 4.0 考的是在终端里完成软件开发、系统配置和数据分析这类复杂任务Astra 拿到 57.9%Sol 只有 37.3%Claude Fable 5.1 是 55.8%。不过这次最让我意外的跑分是 ARC-AGI-3。这个测试难在不给 AI 说明书、不给规则、甚至都不告诉 AI 目标是什么模型进去只能自己乱按慢慢摸清怎么才算赢再把摸出来的规律用到更难的关卡上。它考查的不是 AI 的知识是悟性。今年 3 月这个测试刚发布的时候最强的 AI 只有 0.51 分人类平均 48 分GPT-5.6 Sol 是 7.8 分。而 Astra 做到了 99.9 分把这称作 AI 的开悟时刻不过分吧再看看 GPT-6 的数学能力FrontierMath Tier 4 这套题 Astra 拿到 97.6%基本上算是打穿了。最后说说大家关心的价格。API 里的模型 ID 是gpt-6-astra每百万输入 token 10 美元、输出 50 美元跟 Claude Fable 5.1 一模一样是自家上一代 GPT-5.6 Sol 的 2.5 倍涨得还是挺狠的。但是考虑到大多数用户都是在 CodexChatGPT中使用套餐再加上官方老是赠送重置额度实际开销没有那么大。实战案例跑分看着很爽但我更关心 GPT-6 做出来的东西是什么效果。官方这次放了不少实际案例我挑几个有意思的说说。先看一个最能体现「操作电脑」能力的。官方让 Astra 打开 KiCad 这个电路设计软件把一张电子原理图变成可以直接拿去生产的电路板布线图元器件怎么摆、铜线怎么走全都是它自己完成的。这活儿平时是硬件工程师一点一点手工拖出来的也是整个电子设计流程里最费时间的环节之一。然后是 3D 建模能力官方展示了让 Astra 直接建出一整座城市场景楼体、道路、绿化带、斑马线、路上的车一个都不少。不光是建静态模型。官方还演示了先在 Blender 里把一栋房子建出来再导进 Unreal Engine 5 变成可以自由走动的场景让设计师和客户在开工之前就能提前逛一遍。再看看游戏开发能力官方直接在发布页面里嵌了两个能玩的网页项目鼠标点进去就能上手。第一个是卡丁车竞速游戏这是完全用 AI 程序化生成的 Three.js 卡丁车赛车赛道和场景不是靠网上的素材堆出来的是靠代码算出来的。我自己上手跑了两圈速度表、漂移条、小地图、名次和圈数都在手感也不飘。沙滩的高光、水面的透光、椰子树的剪影、彩旗的排布这水准我觉得已经超过不少外包团队交的活儿了。第二个案例更酷炫是个宇宙飞船船厂。每换一个随机种子就能生成 1000 艘不重复但可复现的飞船全部由 177 个模块化零件拼出来每一艘还带尺寸、载货量、推力、装配模块数这些参数。左边是舰队列表中间是整页图鉴右边是选中那艘船的详细规格还能导出成一张拼版图。除了官方一批提前拿到内测权限的人也在 Twitter 上晒了自己的测试有几个我觉得比官方演示还带劲儿。Matt Shumer 让 Astra 在 Unreal Engine 里造一个世界往里面填满由 Astra 驱动的角色要求他们必须互相合作才能活下去。第二天他在卧室里听见客厅有人说话以为家里进人了走出去还有点害怕结果是那些 AI 角色自己开始互相聊天了。一位研究 T 细胞三十五年的免疫学教授只给了 AI 一句「做一个 5 分钟讲 T 细胞的教学视频」Astra 自己挑了视频框架、调文生图做画面、还主动建议用 AI 配音最后一次性把讲什么、怎么讲、配什么画面全组装好了。教授说凭他三十五年的经验他自己也讲不了比这更好。看完案例你可能会想官方是拿什么样的提示词做出这些东西的这个问题其实有答案。OpenAI 有一个 开发者展示馆里面收录了五十多个用 Codex 做出来的项目而且每个案例的详情页都把当时用的提示词原文一字不改地贴出来了后面还列了每一轮迭代都改了什么。虽然这个展示馆不是这次跟 Astra 一起发的里面的案例大多是用 GPT-5.5 和 5.6 做的但我觉得值得给大家分享一下看官方的提示词能收获不少 AI 编程的启发。随便分享 2 个第一个启发是要逼 AI 自己验收。比如玻璃塔堆叠游戏的提示词最后一句是这么写的Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors.意思是先跑构建和代码检查然后让 AI 在浏览器里玩几局把碰撞、计分、失败和重开都验一遍控制台不许有报错。这就是我一直在讲的 Loop Engineering让 AI 写完自己验验证不通过就自己修复。官方把它写成了提示词里的硬要求。第二个启发是先画图再写代码。小镇模拟游戏的提示词最后一段是让模型先用文生图工具画几张玩法概念图把视觉方向定下来再开始写代码。如果你平时让 AI 做前端总觉得出来的东西土这一招直接助你羽化登仙。剩下的案例我就不逐个讲了放一张成品感受一下水平。AGI 时代真的来了么虽然官方把 GPT-6 Astra 吹得狂拽炫酷吊炸天我看了官方展示的案例也觉得很牛呗但是网上有很多不同的声音。第三方评测机构 Artificial Analysis 在发布当天就出了独立评测结论跟官方不太一样。在他们的综合智能指数里Astra 是 61 分跟上一代 GPT-5.6 Sol 一模一样比 Claude Fable 5.1 还低了 5 分。图里右边那一栏是单个任务的成本Astra 1.67 美元GPT-5.6 Sol 0.94 美元。智能指数一分没涨成本快翻倍了所以「全球最强」这个说法在 OpenAI 自己挑的那批测试上成立一换成第三方的综合指数就未必成立了。而且根据历史情况我们可以大胆假设GPT-6 Astra 大概会像其他模型一样第一周用起来像是在跟神说话一周后厂商为了省算力搞一波降级再用起来就像是在跟三岁小孩说话两周后被用户投诉多了就再把智力调回来一点几周之后再发布 GPT-6.1然后循环……就分享到这里吧等我拿到 GPT-6 Astra 的使用权限再跑几个 AI 编程实战项目测测看。本文会收录到我免费开源的 《AI 编程零基础入门教程》上千张图、几十万字带你从 0 开始快速学会 AI 编程做出自己的产品、跑通变现全流程一次拿捏。开源指路https://github.com/liyupi/ai-guide我是鱼皮持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~评论区有没有已经用上 GPT-6 Astra 的朋友聊聊你们的使用感受