Kimi K3发布时,2.8万亿参数、前端榜单第一、开源模型新王,几个标签挤在一起,热闹得像AI圈又过了一次年。五天过去,跑分没塌,惊艳案例也不是假的,可真实用户开始抱怨它慢、烧Token、连续改需求不够顺。问题来了:这到底是一次货真价实的能力跃迁,还是又一场被首发情绪放大的狂欢?
榜单第一是真的,但“第一”只有一张窄窄的门票
先把最容易吵起来的事说清楚:Kimi K3的前端能力确实强,不是媒体硬捧出来的。
你在首发截图里看到的是K31679分、GPT-5.6 Sol xhigh1631分;到7月20日、累计501431票时,榜单已重算为K3 1677分、Claude Fable 5为1636分、GPT-5.6 Sol xhigh为1633分。Arena会根据新增匿名对战投票持续更新Bradley–Terry评分,所以这两组数字并不矛盾,只是不同时间切片。这个榜单看的是前端网页开发,包括多步推理与工具调用,已经比“写一个登录页”严肃得多。
7月20日这版榜单还把K3标记为Preliminary,初步成绩。也就是说,它已经拿到第一,但新模型的有效票数仍在积累,分数和排名还可能继续变化。
分数会动,适用范围也得看清。WebDev第一不等于后端第一、安全审计第一,也不等于你把一整个仓库扔过去,它就能一次性交付生产系统。
官方其实没躲。Kimi的技术博客写得很直白:K3整体表现仍落后Claude Fable 5和GPT-5.6 Sol,用户体验也存在“明显差距”。首发文章里最容易被忽略的,偏偏就是这两句。
概念上也要分清:Kimi K3本体是原生多模态大语言模型(Multimodal Large Language Model,MLLM),能同时处理文本与视觉信息。它负责理解任务、推理和生成内容,但模型本身不会凭空操作终端、修改文件或点击浏览器;这些动作需要外部Agent工具链提供执行能力。
参数也得拆开看。**混合专家模型(Mixture of Experts,MoE)**会把模型分成许多“专家”子网络,每次只调用一小部分处理当前任务。K3总参数2.8万亿,但每个Token只激活896个专家中的16个。说白了,不是2.8万亿参数每次一起开工,而是一个巨型人才库按题叫人。
很猛。也很重。
官方建议部署在64张以上加速卡组成的超节点上。看到这里,“个人本地跑一个全球最大开源模型”的浪漫想象,可以先收一收。完整权重还要等到7月27日发布,现在谈开源生态已经成熟,太早。
真正让我服气的,不是页面好看,而是它能把长任务咬住
四篇首发实测里,最有价值的不是那些会发光的3D页面,而是以K3为推理核心的Agent系统遇到错误之后还往下干。
Datawhale使用的是K3模型 + Kimi Code + WebBridge:K3负责理解目标、判断报错与规划下一步,Kimi Code负责读写代码、执行终端命令,WebBridge负责验证浏览器页面。这套系统接手论文引用图谱项目后,启动服务时连续碰到三个ModuleNotFoundError,逐个补齐依赖;随后改数据库、增加REST接口、联调前端,再跑8步端到端验证。
新增36项测试全部通过。全量测试出现2个失败后,Agent又调用git stash撤回改动复测,确认是项目原有问题。
模型不是Agent;模型接上工具、执行环境与反馈循环,才构成Agent。
**AI Agent不是只会回答问题的聊天模型,而是一套“模型决策、工具执行、观察结果、继续修正”的工作流。**普通点说,K3像大脑,Kimi Code和WebBridge像手、眼睛与工作台;把它们组合起来,系统才能打开终端、跑测试、看页面,再决定下一步。
另一篇实测更野:让这套K3 Agent系统做网页版Excel,再自主参加Kaggle房价预测。Excel跑了约一小时;Kaggle任务持续十多个小时,从Ridge换到Random Forest,再到Gradient Boosting和stacking,终于把成绩推到目标附近。
这类长任务比“一句话生成网页”更能说明问题:接入Kimi Code等工具后,K3不只生成一次答案,还能根据报错、测试结果和任务进度重新规划。真正值得关注的,是它作为Agent推理核心时表现出的持续纠错能力。
不过话又说回来。能咬住,不代表咬得快。
首发滤镜遮住的另一半:慢、烧Token、成品差临门一脚
Datawhale用相同提示词让K3和GPT-5.6 Sol复刻5款经典游戏。K3的版本都能打开,核心玩法也成立;拳皇角色渲染等单点甚至更亮眼。可一到菜单、暂停、选关、存档校验、碰撞边界这些不性感的地方,差距就冒出来了。
K3擅长把“没有”迅速做成“有”,GPT-5.6 Sol更擅长把“有”磨成“能长期用”。
这句话比“谁吊打谁”有用。
比如K3做的魂斗罗能移动、能射击,却缺标题画面、暂停和继续,悬浮平台看着像平台,人却站不上去。视觉先把你哄开心,工程细节在后面悄悄漏风。挺像一套样板房:第一眼真漂亮,住进去才发现插座少了两个。
速度更扎心。Datawhale记录中,GPT-5.6 Sol借助Codex的并发子Agent,完成时间约为K3的25%。一位同时使用K3和Fable的Reddit用户称,K3吞吐约20 token/s,适合把长功能扔给它后台跑;若要连续小步修改,等待会把节奏切得稀碎。
20 token/s只是单个用户当时的体感,不能当平台承诺。但方向对得上:官方错误文档已经列出引擎过载、并发过高、5小时滚动额度和月额度限制;7月19日,Kimi又因需求逼近容量上限暂停新订阅,优先保障已有会员。
糟心吗?当然。花钱订了会员,任务跑到一半却撞上过载或额度墙,谁碰上都得火大。把这种体验轻描淡写成“成长中的烦恼”,太扯了。
更容易被“低价”两个字藏起来的是Token消耗。官方API价格并不离谱:缓存命中输入0.30美元/百万Token,未命中输入3美元,输出15美元。可**单价低,不等于任务总价低。**社区里有人用K3一次生成咨询公司网站,花掉最低档编码方案约四分之一的周额度;也有人估计,同类任务的Token量可能达到Claude或GPT的两倍。
这些都是用户个案,不适合算成一张精确价目表。可它们提醒了一件很朴素的事:买模型别只盯每百万Token多少钱,要看一个任务做完烧掉多少、花多久、返工几轮。
不然便宜只是计价单位很便宜。账单照样胖。
如果现在让我选:K3不是平替,它是一把偏科但凶的刀
如果你做前端原型、3D交互、游戏Demo、数据可视化,需求相对完整,又愿意让任务跑一阵,K3已经很有竞争力。它的创意和首轮完成度不是玄学,Arena排名、媒体横测和社区反馈能互相对上。
如果你在已有大仓库里做持续结对编程,一天几十轮小改动,还要求严格遵循AGENTS.md、补齐安全边界、处理大量暗角,我不会急着把Claude或GPT换掉。至少发布五天后的证据,还撑不起“全面平替”这四个字。
如果你只想尝鲜,也先别被1M上下文冲昏头。官方文档显示,K3需要Moderato及以上会员;1M上下文要到Allegretto及以上。额度还有周限制、5小时窗口和月度上限。**先拿一个真实任务试,再决定是否迁移工作流。**别用俄罗斯方块Demo替自己的生产代码投票。
我的选择会很具体:长任务、完整规格、前端探索交给K3;高频来回、严格审查、临门20%的产品打磨,继续留给更稳的工具。不是端水,而是把活儿分对。
K3证明的不是开源模型已经通杀闭源,而是开源模型终于有了让顶级闭源模型难受的长板。
假如你从2026年开始学大模型,按这个步骤走准能稳步进阶。
接下来告诉你一条最快的邪修路线,
3个月即可成为模型大师,薪资直接起飞。
阶段1:大模型基础
阶段2:RAG应用开发工程
阶段3:大模型Agent应用架构
阶段4:大模型微调与私有化部署
配套文档资源+全套AI 大模型 学习资料,朋友们如果需要可以微信扫描下方二维码免费领取【保证100%免费】👇👇