ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

谷歌六周连发三版Flash,Gemini 3.8性能、成本双优,能否在AI赛道突围?

2026/9/4 5:19:56 拓冰建站 浏览量
谷歌六周连发三版Flash,Gemini 3.8性能、成本双优,能否在AI赛道突围? 谷歌发布Gemini 3.8性能提升显著昨晚谷歌发布了其迄今为止最强的推理与编程模型Gemini 3.8。它在保持低成本的同时在定量及专业领域以及端到端自主解决复杂工程问题方面有了进一步提升。模型亮点解读谷歌DeepMind研究员姚顺宇说“这次模型发布对模型来说是一小步对RSI递归自我改进来说却是一大步。”新推出的Gemini 3.8包含两款模型Gemini 3.8 Flash主力模型上下文窗口为100万个token在软件工程、智能体任务以及专业领域中的关键多步推理等方面相较3.7 Flash均有明显提升。Gemini 3.8 Flash Cyber网络安全模型在漏洞检测和自动修补方面达到前沿水平将通过全新的Fairwind计划向受信任的防御者开放。两个模型共享同一套基础智能由长时运行的Agentic loop进一步加速。这类loop用于递归评估和优化底层模型使该共享核心的编程、推理能力获得显著提升。基准测试成绩优异基准测试方面Gemini 3.8 Flash在14项测试中有8项成绩排名第一超过了Claude Opus 5和GPT - 5.6 Sol包括金融分析测试Vals Finance Agent v2、法律工作流测试Harvey Legal等。在Artificial Analysis智能指数上Gemini 3.8 Flash取得59分与GPT - 5.6 Sol和Grok 4.6的非最高推理配置持平。在推理成本上Gemini 3.8 Flashhigh每个智能指数任务成本为0.58美元是同等级智能水平下最便宜的模型。中等推理模式下每任务成本降至0.41美元低推理模式下降至0.24美元。价格对比优势明显价格方面Gemini 3.8 Flash目前采用优惠定价为每百万输入token 0.75美元、每百万输出token 3.75美元其标准定价为每100万输入token 1.5美元、每100万输出token 7.5美元。对比来看Claude Opus 5定价为输入每百万Token 5美元、输出每百万Token 25美元是Gemini 3.8 Flash标准定价的3倍多GPT - 5.6 Sol定价为输入每百万Token 5美元、输出每百万Token 30美元是3到4倍Terra定价约为2倍Luna定价更为便宜。开发者体验反馈良好在外网已有不少开发者体验了Gemini 3.8 Flash。有开发者对比了Gemini 3.8 Flash和Claude Opus 5对于同一个海浪模拟器任务Opus 5耗时24分钟3.8 Flash仅用了37秒但Opus 5的成果细节处理较完善。该开发者很乐观称“如果给Gemini和Opus 5相同的时间Gemini在质量上也会把Opus彻底碾压。”外网AI模型测评博主Lumina对比多款模型后评价称“Gemini 3.8 Flash明显清爽利落得多是这里面生成质量最好的之一。谷歌这次升级确实不错。”在官宣推文的评论区中多数用户留言期待Pro版本模型发布。Meta同期发布新模型竞争激烈与谷歌前后脚Meta在今日凌晨发布了Muse Spark 1.3。在Artificial Analysis智能指数排行上Muse Spark 1.3超越了Gemini 3.8 Flashhigh仅次于Claude Fable 5.1和Claude Opus 5。Meta首席AI官Alexandr Wang汪涛转发推文并明呛谷歌“gemini是谁”实际应用表现出色那Gemini 3.8 Flash在实际应用中表现如何呢谷歌团队放出实测案例它能仅凭简单提示词构建游戏、功能完整的DOS版谷歌地图、地形图等。中国AI博主Chasen实测“鹈鹕踩单车”输出速度快但存在画面瑕疵。还有开发者用其生成3D汽车模型。目前Gemini 3.8 Flash可通过多种方式调用不同用户群体有不同体验途径。基准测试多领域领先在长周期软件工程基准测试DeepSWE v1.1上Gemini 3.8 Flash在端到端自主解决复杂工程问题方面表现超多数前沿模型成本降低。在专业知识领域如金融、法律等基准测试中表现优于前代和其他前沿模型。在人类最终测试HLE - Verified基准上取得54.9%的成绩证明多步推理能力。在任务完成速度上不同推理模式下表现良好在“智能水平vs.每任务耗时”权衡中达到帕累托前沿。安全模型能力突出与Gemini 3.8 Flash一同发布的Gemini 3.8 Flash Cyber在漏洞发现基准上超越多款模型。在内部基准评估中成功率超70%能力大幅提升。谷歌团队开发时注重为防御者赋予能力优先修复漏洞。在外部补丁能力测试上pass1达47.2%成本显著更低已处于帕累托前沿。在实际应用中它在谷歌内部代码安全防护、Chrome漏洞补丁生成、Wiz公司内部测试、谷歌云漏洞研究等方面表现出色。目前网络安全领域受信任机构需通过Fairwind计划单独申请访问。结语谷歌发展待解难题谷歌在六周内迎来第三次Flash版本更新迭代速度快。然而用户对旗舰级Pro版本期待强烈。同时Meta同日发布新模型AI模型赛道竞争激烈。对于谷歌而言如何平衡发布节奏、满足不同用户群体需求、保持技术领先仍是值得关注的课题。值得注意的是谷歌DeepMind研究员姚顺宇的评价或许暗示谷歌押注的是模型自我迭代、进化的底层能力。谷歌能否在激烈竞争中脱颖而出呢