ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

减速倡议下,谷歌疑似Gemini 4 Pro泄露,AI竞赛又要狂飙?

2026/9/19 23:01:14 拓冰建站 浏览量
减速倡议下,谷歌疑似Gemini 4 Pro泄露,AI竞赛又要狂飙? AI竞赛中谷歌的异常安静与突然现身的神秘模型前几个月OpenAI和Anthropic轮番把旗舰模型往前推谷歌却显得异常安静。Flash几乎3周一更3.6、3.7、3.8连续往前但代表最高能力上限的Pro迟迟没有动静。直到这两天大模型盲测竞技场Arena里突然冒出一个挂着gemini - 3.8 - flash名字的模型。开发者上手后发现不对劲真正的Gemini 3.8 Flash已发布大家对它的水平心里有数可这个“3.8 Flash”写代码、做SVG、跑Agent表现明显更上一层楼。几轮实测后一个猜测迅速扩散这个模型很有可能是谷歌藏在标签后面的下一代旗舰——Gemini 4 Pro。紧接着一张更夸张的benchmark对比图开始疯传编码、Agent、推理等多项成绩都把GPT - 6 Astra和Claude Fable压在下面。我就纳闷了这谷歌之前悄无声息现在突然冒出这么个厉害的疑似模型是早就憋了大招吗疑似Gemini 4 Pro的实测表现与线索9月2日Google刚正式发布Gemini 3.8 Flash官方称这是Gemini 3系列最新一代Flash在软件工程、Agent任务和复杂多步推理上都有明显提升且从3.7 Flash到3.8 Flash只隔了三周。所以当Arena里又出现同样挂着gemini - 3.8 - flash名字的模型时开发者很快察觉到异常。真正的3.8 Flash有现成参照物而这个模型明显更强分明是Pro模型才有的实力。最早引发传播的一批实测集中在SVG、网页和3D场景上。开发者Harshith让它用SVG画一只侧面的家猫并与GPT - 6 Astra Max和正式版Gemini 3.8 Flash对比Arena里的这个版本在轮廓、比例和细节完整度上都和正式3.8 Flash拉开明显差距。网友thtbee_从多个角度测试这个疑似Gemini 4 Pro的模型一个Voxel风格宝塔模型8分钟生成可交互3D场景一架空客H145直升机约10分钟搭出完整3D展示页面不过页面底部UI元素“看起来有点糟”在网页设计上约14分钟做出单色主题网站整体干净、完整过去Gemini被吐槽的设计品味问题似乎也补上了。另一位网友Mr_Salio用它做游戏成品画面流畅世界生成和游戏设计完成度高。更关键的线索来自开发者Qwinah他声称成功“幽灵路由”到Gemini 4 Pro的后端并贴出疑似内部终端信息的截图。据他所说这个模型内部标识有G4P - ARGON和VIA_3.8_FLASH最大输出256K上下文窗口超1000万token还有跨会话永久记忆、无需API联网、后端自动编译运行脚本甚至物理机器人控制等能力。如果这些信息属实那这可就不是普通的Flash升级了。与此同时一张Gemini 4 Pro的benchmark对比表在社区疯传。按照表中数据Gemini 4 Pro在软件工程测试DeepSWE v1.1拿到88.7%在终端Agent测试Terminal - Bench 2.1达到95.3%在专家级知识推理测试HLE - Verified冲到72.1%在电脑操作Agent测试OSWorld 2.0达到86.8%在衡量真实知识工作的GDPval - AA v2上被写成2064 Elo直接突破2000大关。要是这些数据是真的Gemini 4 Pro真能“拳打Fable脚踢Astra”站上前沿模型之巅。但问题是这张benchmark表和Qwinah“挖”出来的疑似后端截图对不上benchmark表里Astra得分也不符合官方数据两份材料都没官方背书目前只是社区流传信息。唯一能确定的就是那个叫gemini - 3.8 - flash的模型表现和Gemini 3.8 Flash不符。大家把答案指向Gemini 4 Pro还有个重要原因Google的Pro模型空窗太久Gemini 3.5 Pro未正式落地Gemini 4已确认训练过去几个月Flash升级Pro线没新型号现在突然冒出个能力异常的“3.8 Flash”猜测也就越来越像回事了。RSI——Gemini 4 Pro背后更大的关键词如果说Gemini 4 Pro目前只是社区传言那更值得注意的是谷歌在加快AI参与模型研发的速度。在Gemini 4 Pro传闻里RSI这个关键词反复被提及。RSI全称为Recursive Self - Improvement递归自我改进简单说就是AI参与制造更强的AI更强的AI又加快下一代模型研发。一旦这个循环开启加速的不只是模型能力还有模型进化速度。路透社今年8月披露谷歌联合创始人Sergey Brin近几个月推动Gemini提速并把递归自我改进列为重点关注方向之一。虽然谷歌没公开宣布实现闭环但它把越来越多研究员的工作交给Agent包括评测模型、找改进方向、跑实验再反馈到模型研发流程。9月2日发布Gemini 3.8 Flash时谷歌官方说明提到一套长期运行的Agent循环在“递归地评估和改进底层模型”。Google DeepMind研究员姚顺宇化用阿姆斯特朗登月时的话形容这次更新“这是模型的一小步RSI的一大步。”最近谷歌还把“RSI”写进新论文标题。9月14日谷歌、GDM等团队发布Dream - RSI研究如何让Agent通过改进探索策略实现递归自我改进这套方法在算法工程、数学优化和GPU kernel任务上有更高探索效率和更低搜索成本。正因如此Gemini 4 Pro传闻才和RSI绑在一起。社区猜测不仅是“Gemini 4 Pro很强”还在追问谷歌内部把RSI做到什么程度。其实RSI这条路不止谷歌在走。美国时间9月17日Anthropic公开内部AI研发自动化数据。Anthropic官方称公开指标是让外界知道前沿实验室里AI研发由AI完成的情况。数据显示截至今年8月Claude能主导26%的Anthropic AI研发任务今年2、3月这个比例还不到1%同时Anthropic内部超90%的AI研发任务至少进入AI协作阶段。国内智谱创始人兼首席科学家唐杰表示“我们仍远未达到递归自我改进但最小的循环已经出现模型优化系统系统服务模型。”在智谱公开工程实践中由GLM - 5.3驱动的Infra Agent参与GLM - 5.3 - Flash推理基础设施设计、调试和优化系统运行在超10万张国产AI芯片集群上从跑通到承接全部生产流量只用两周端到端吞吐提升到初始水平的3.2倍。“减速”倡议下的尴尬现状就在几天前阿莫迪呼吁前沿AI公司携手“减速”他列出的首个警觉条件就是RSI。模型进步是好事但如果AI参与制造下一代AI模型进步速度加快人类理解、评估和控制它的速度未必同步。所以阿莫迪强调要在能力跨过门槛前提前建立第三方评测、共同安全标准和减速机制因为RSI形成正反馈后模型可能越过刹车“安全距离”。在风险上几家前沿实验室达成共识。奥特曼认同“放慢前沿AI的发展节奏”承诺OpenAI引入独立评测者马斯克表示“Dario是对的”哈萨比斯称这是正确方向只是具体做法待讨论。但倡议提到单独减速没意义若AI研发被AI加速未来有效减速或暂停需建立共同规则比如引入独立评测者前沿实验室共同设定能力门槛和安全措施必要时协调放慢研发速度。然而到现在出于竞争原因共同规则没建立起来。大家能说“应该谨慎”但一到“具体怎么减速、谁先减、其他国家减不减”就没了共识。实验室有模型竞争国家有AI竞争哪家单独放慢或哪个国家单独限制都有风险。几家前沿AI实验室言行不一。谷歌有疑似在Arena匿名测试的Gemini 4 ProAnthropic社区出现Opus 5.2灰度痕迹有Claude Code用户怀疑部分请求被灰度到下一代OpusOpenAI有人在后台模型列表看到gpt - 6 - sol模型名有人疑似被灰度到新模型据消息GPT 6 Sol可能下周发布也可能在美国时间9月29日的Dev Day。这轮“减速倡议”到现在没一家真减速只是把风险公开讲了一遍模型没放缓。但至少出事时他们能说我们早就提醒过了。这AI竞赛到底该怎么平衡发展和风险呢