ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

智谱GLM-5.3-Flash低价挑战DeepSeek,AI大模型性价比之王要易主?

2026/8/29 11:30:18 拓冰建站 浏览量
智谱GLM-5.3-Flash低价挑战DeepSeek,AI大模型性价比之王要易主? 【智谱挑战DeepSeek】当了这么久的“价格屠夫”DeepSeek终于也等来了砍向自己的一刀动刀的是智谱。智谱AI刚刚发布的GLM-5.3-Flash即是风靡海外社区的神秘大模型OX Alpha也是GLM-5系列里的第一个原生多模态模型。【GLM-5.3-Flash性能与价格优势】虽它的名字带着Flash但性能可一点都不Flash特别是在Artificial Analysis Intelligence Index上它拿下57分高于DeepSeek V4 Pro正式版的53分连官方也毫不谦虚说在某些口径上性能甚至可以对标之前Claude的旗舰Opus 4.8。据悉GLM-5.3-Flash最震撼的莫过于模型一上线就把“便宜”两个字写在了脸上。每百万Token输入0.8元、输出2.8元甚至还有两周限时半价优惠。能力可以对标Opus 4.8价格却只有它的1/40甚至比“价格屠夫”DeepSeek的闲时价格还要低。而这恰恰是DeepSeek最熟悉的打法。前脚主打超绝性价比的DeepSeek开始执行峰谷定价涨幅最高可达1100%后脚GLM-5.3-Flash就价格压到了“日常消耗品”的区间。难道AI大模型性价比之王要“改朝换代”了【从“牛来”模型说起】要了解GLM-5.3-Flash还是得从一头神秘的“牛”说起。8月20日AI聚合平台OpenRouter突然上线了一个名为Ox Alpha的匿名模型。没官宣、没预热没有公布开发者没有披露参数规模更没有给出技术报告堪称“野模”。适逢动画电影《牛来》走红而“Ox”本身就是“牛”的意思于是中文开发者顺手借梗把Ox Alpha叫成了“牛来”模型。“野模”虽“野”却相当大方Ox Alpha可以接收文本、图片和视频输入输出文本匿名测试版本还提供104万Token上下文然而开发者调用它却不用花一分钱全部由模型公司买单。这种几乎“白嫖”的方式让Ox Alpha迅速走红。上线不到一天Ox Alpha同时登顶了OpenRouter和OpenCode两个调用量榜创下了OpenRouter的模型发布纪录终结了DeepSeek连续56天霸榜的纪录。就连Hermes Agent创始人也震惊发文这个模型正在屠杀我们所有的内部基准究竟发生了什么一时间猜测Ox Alpha背后的“爹妈”成为了开发者社区的新乐子。毕竟能拿出这种性能模型的还出手如此阔绰的背后大概率不会是个“无名之辈”。事实上果真如此。背后是智谱这样的头部大模型公司当然解释了它为什么有底气替全球开发者买单。但再家大业大也经不起海量Token一直免费烧下去。Ox Alpha敢于如此阔绰还因为这头“牛”看着块头很大饭量却比想象中小得多。GLM-5.3-Flash拥有3200亿总参数但每处理一个Token只会激活约180亿参数占比只有5.6%。面对104万Token的超长上下文它又把线性注意力和稀疏注意力结合起来尽量减少处理海量历史信息所需的计算量。两套设计服务的其实是同一个目标模型看起来是个3200亿参数的大块头实际账单却尽量不按3200亿参数来开。这才是智谱出手阔绰的另一层底气公司负责兜底模型自己也得学会省钱。现在回头看Ox Alpha匿名期间的免费大放送本身也像是一场“低成本宣言”。海量Token全部由智谱买单除了测试模型、制造热度也是在向开发者证明智谱敢把调用量彻底放开是因为这款模型本身就没有想象中那么烧钱。总价下来就是一句话这头“牛”确实吃得不多。【瞄准Agent场景】到了Agent场景这一点就更加重要了。一次任务可能连续调用模型几十次甚至上百次单次调用省下的一点成本最终都会被高频调用不断放大。所以GLM-5.3-Flash的架构真正瞄准的是让Agent把大模型当成一种可以高频消耗的基础设施。而在开发者心中“性能强、价格低、可以放心调用”这些标签过去几乎都属于DeepSeek。智谱真正想冲击的恐怕正是DeepSeek最值钱的性价比招牌。【发布时间巧妙】GLM-5.3-Flash发布的时间点相当巧妙。7月31日DeepSeek V4 Flash正式版上线后OpenCode上的使用量单日增长了30%OpenCode Go的新订阅用户也增长了30%。仅8月1日一天DeepSeek V4 Flash的单日处理量就高达8万亿Token。但8月17日DeepSeek的新版定价正式生效。DeepSeek V4 Pro高峰时间段涨幅最高达1100%DeepSeek V4 Flash峰时输出价格也从0.28美元提高到1.32美元涨了4.71倍。大幅涨价最直接的影响就是开发者开始用脚投票。此前流出的梁文锋录音中他曾提到智能需求没有弹性。但现实似乎没那么简单尤其对于轻量级模型。涨价后DeepSeek的日Token用量很快跌到了此前峰值的一半以下。OpenCode CEO甚至估算平台因此空出了接近10万亿Token的日需求。偏偏就在这个时候披着“牛来”外套的GLM-5.3-Flash来了。【价格对比】GLM-5.3-Flash堪称“便宜大碗”每百万Token缓存未命中输入0.8元、输出2.8元相当于GLM-5.3的十分之一。上线后还有两周限时半价优惠缓存未命中输入0.4元、输出1.4元缓存命中输入0.115元优惠一直持续到2026年9月9日24时。按这组最显眼的价格来看GLM-5.3-Flash确实杀气腾腾。但要判断GLM-5.3-Flash究竟有没有砍到DeepSeek只看缓存未命中输入和输出还不够。因为到了真实的Agent场景缓存命中价格反而可能成为账单的大头。所谓缓存命中可以简单理解成Agent反复调用模型时经常会带着相同的系统提示词、工具定义、历史对话和代码。这些内容平台此前已经计算过下一次可以直接复用。既然是用过的东西再拿出来用那价格当然也比“缓存未命中”的便宜。这在普通聊天里可能没那么重要但Agent完成一次任务往往要连续调用模型几十次甚至上百次同一套任务背景和历史记录会被反复塞进上下文。特别是写代码这类输入很长、输出相对较短的任务缓存命中价格会更多地影响账单。这也是智谱定价里藏着的一点小心思。它在宣传中重点突出每百万Token输入0.8元、输出2.8元以及限时半价后的0.4元和1.4元。按照缓存未命中输入和输出比较GLM确实比DeepSeek便宜。但GLM-5.3-Flash的标准缓存命中价格是0.23元半价期间也要0.115元。DeepSeek V4 Flash峰时只要0.1元谷时更低至0.05元。只看缓存这一项即便在半价期间GLM也比DeepSeek峰时更贵恢复原价后更是DeepSeek峰时的2.3倍、谷时的4.6倍。假设一个Agent任务累计输入50万Token其中99%命中缓存最终只输出1万Token。也就是49.5万Token按照缓存命中计费剩下5000 Token按照缓存未命中计费。优惠结束后这个任务使用GLM-5.3-Flash大约需要0.146元使用DeepSeek V4 Flash谷时只需要约0.077元峰时则需要约0.155元。按照这个假设同一个任务GLM比“梁文谷”贵了接近90%只比“梁文峰”便宜了不到6%。这也解释了为什么有开发者实际使用后发现GLM综合用下来比DeepSeek谷时更贵只是比峰时便宜对于高缓存命中的Agent任务GLM在输入和输出上省下的钱很容易被更贵的缓存吃掉。更关键的是智谱的半价优惠只有两周9月10日就会恢复原价。所以GLM-5.3-Flash只能砍过“梁文峰”却未必砍得过“梁文谷”。但除了缓存命中GLM-5.3-Flash其他方面的定价确实全面低于DeepSeek。【国产算力支撑】DeepSeek已经够便宜了智谱究竟是怎么在保持不错性能的同时还把价格地板继续打穿的而答案就藏在支撑这头“牛”的算力里。不光模型出自国内撑住这波全球海量真实流量的算力用的也是国产方案。匿名上线期间Ox Alpha单日处理量一度达到约62万亿Token线上流量全部由10万张国产芯片扛下。有媒体报道这些芯片可能来自华为、摩尔线程和海光。当然把10万张卡堆在一起并不会自动变成一套高效的推理系统。按照智谱的说法这批国产芯片面临的主要瓶颈是内存容量和带宽。为了支撑最长104万Token的上下文智谱在SGLang基础上搭建了一套专用推理引擎把多模态编码、提示词预填充和逐Token解码拆开分别进行调度和扩缩容再通过量化、并行和内存优化尽可能把国产芯片的性能榨出来。更有意思的是这套系统的优化也有GLM-5.3自己参与。智谱用Infra Agent协助工程师开发和优化算子、诊断性能瓶颈、改进部署服务栈形成了一个“模型优化系统系统承载模型”的循环。智谱称与同一批硬件上的初始基线相比这套系统的端到端服务性能提升了3倍硬件效率和单Token成本已经达到主流英伟达GPU的水平。国外半导体研究机构SemiAnalysis也评价称英伟达的护城河再次受到了考验。模型架构负责少算推理系统负责把国产芯片的性能尽量榨出来两者合在一起才构成了智谱继续压低价格的工程底座。这当然不是说国产芯片已经全面追上英伟达。10万张国产卡承载全球开发者的真实流量能够证明的是这套系统已经具备大规模服务能力至于硬件效率和单Token成本是否真正达到主流英伟达GPU的水平目前仍主要来自智谱自己的测算。但这头“牛”真正难缠的地方是它背后站着的除了一个国产模型还有一整套被真实流量压过的国产算力方案。对于DeepSeek来说这恐怕比单纯的低价更棘手。你是否会关注GLM-5.3-Flash后续的发展呢