2.8万亿!全球参数量最大的开源模型Kimi K3,究竟能力如何? 文章目录速览排名对比LiveBench 排名LMArena 排名Artificial Analysis 排名实测Kimi Code Plan思考速览月之暗面Moonshot AI于7月17日X上的发布时间发布Kimi K3。昨天我用了一下感觉还不错故写文分享一下。我做的事情是优化OBS开源录屏软件实现随意框选区域进行录屏无需多余操作增加桌面悬浮窗实现快速录屏和停止、快速录制选区。这两天稍微处理一下就发布。回到 Kimi K3它是目前全球参数规模最大的开源大模型参数量达到了 2.8 万亿级别。 1M 上下文窗口 low / high / max 三档思考深度擅长复杂工程任务与长程推理原生多模态。目前国内的几个顶级模型都表现不错Deespseek、GLM、Qwen、Kimi…而且都是开源。简单对比一下模型厂商发布时间总参数量专家架构上下文窗口模态开源状态Kimi K3月之暗面07-172.8TMoE (激活约50B)1M多模态文本、图像、视频输入文本输出计划开源完整权重预计 2026 年 7 月 27 日前放出DeepSeek V4 Pro-Preview深度求索预览版04-24正式版即将发布1.6TMoE (激活约49B)1M纯文本无多模态已开源MIT 协议GLM-5.2智谱AI06-13753BMoE (激活约40B)1M纯文本无视觉能力已开源MIT 协议Qwen3.8-Max-Preview阿里云07-192.4TMoE (激活参数未公开)1M多模态文本、图像、视频、文档预览版闭源正式版计划开源时间未定MiniMax-M3稀宇科技06-01428BMoE (激活约23B)1M原生多模态文本、图像、视频开源权重价格对比说明国产模型以**人民币元/百万Token计价海外模型以美元USD/百万Token**计价价格均为厂商公开的标准零售价格不含企业定制、批量折扣。具体的各个模型的价格计算可能比下图/表列举的复杂一点这里就不展开了大致比较一下。模型标准输入价标准输出价缓存命中输入价定价规则与备注Kimi K320 元100 元2 元全上下文窗口统一费率支持1M token上下文DeepSeek V4 Pro3 元6 元0.025 元默认开启思考模式无额外加价1M token上下文统一价GLM-5.28 元28 元2 元全上下文窗口统一费率支持1M token上下文Qwen3.8-Max-Preview约 12 元*约 36 元*约 1.2 元**参考上一代Qwen3.7-Max官方标准价推算当前为预览阶段无公开按量付费单价仅通过订阅Credits计费预览期享标准价1折优惠MiniMax-M3≤512K2.1 元 512K4.2 元≤512K8.4 元 512K16.8 元≤512K0.42 元 512K0.84 元官方永久五折后价格按输入Token长度阶梯计费GPT-5.6 Sol$5.00$30.00$0.50GPT-5.6系列旗舰版本同系列还有均衡版Terra$2.5/$15、轻量版Luna$1/$6两个档位Claude Fable 5$10.00$50.00-Anthropic当前旗舰模型1M token上下文官方支持上下文缓存约90%折扣具体费率未单独公示可以看到Kimi K3在国产开源模型中参数量最大价格也最高比此前我觉得贵的GLM-5.2还要贵不过比GPT和Claude这2个顶级闭源模型便宜。排名对比我这几天看到的 Kimi K3 评价都是比较好的这里再看一下跑分排名吧这里的排名有专业评测和真人主观评价等不同模式。Kimi K3、DeepSeek V4 Pro-Preview、GLM-5.2、MiniMax-M3LiveBench 排名核心特点每月更新测试题目所有问题都有客观标准答案彻底避免 AI 模型训练数据污染问题评估维度数学推理、代码生成、知识问答等多个领域强调模型的真实学习与问题解决能力适用场景适合评估模型的客观能力边界而非主观用户偏好官网https://livebench.ai/综合排名Kimi K3来到了第6名。更多排名情况数值为得分得分下面是排名基本全是最强的LMArena 排名核心机构加州大学伯克利分校 LMSYS 组织开发维护核心机制匿名盲测对战用户在不知模型身份的情况下对两个 AI 回答投票采用国际象棋 ELO 评分系统覆盖范围全球 190 主流大模型涵盖文本对话、数学推理、编程、图像生成等多个竞技场特点月活用户 500 万 覆盖 150 国家每月 6000 万 模型对话细分多语言榜单中文、英文等数据公开且每日更新被称为 AI 领域的 “奥运会”结果反映真实用户体验偏好官网https://arena.ai/zh/leaderboard排名对比数值为最高排名模型TextAgentWebDevKimi K3841DeepSeek V4 Pro432233GLM-5.2 (Max)29114MiniMax-M3602421在前端网页开发这一项排到了全球第一Artificial Analysis 排名核心特点综合 10 项评估维度从 “AI 智商” 角度全面衡量模型能力包含逻辑推理、抽象思维、学习能力等评估方法结合客观测试与专家评审结果具有较高参考价值最新版本Intelligence Index v3.0覆盖主流闭源与开源模型官网https://artificialanalysis.ai/排名对比评测项目Kimi K3GLM-5.2MiniMax-M3DeepSeek V4 Pro总体综合指数391515智能体真实工作任务391114智能体工具使用182111代码与终端能力3111618纯代码能力2141914复杂推理与知识6101416科学推理116516物理推理672114知识准确率8182610长上下文推理19219长周期知识工作27910和更多模型比较从前面的一些排名中可以看到Kimi K3 整体差不多达到了全球第三的水平某些领域则达到了第一。可喜可贺。但其实还是有较大差距的。再来看一下LMArena 排行里面的前10名模型可以看到这8项排名里面大多数都是GPT和Claude国产只有12.5%。对国产模型的崛起我即为之喜又为之贺但不可盲目自信。实测如开头所说我昨天对OBS做了功能优化实现随意框选区域进行录屏无需多余操作增加桌面悬浮窗实现快速录屏和停止、快速录制选区。绘制区域进行录制时自动添加默认音频做到框选后就可以直接录制目标区域音视频。更多细节后续发布。最开始是使用GLM-5.2做的但它一直无法处理自动设置画布分辨率的问题。之后使用 Kimi K3 得以实现。最终效果如下图我是obs深度用户这项功能的增加我认为非常使用。还有几个小功能需要增加预计这几天就会构建安装包并开源并给官网提交PR。Kimi Code Plan不出意外的话和智谱一样的套餐售罄DeepSeek虽然最便宜不过高峰期白天价格也是翻倍的。我昨天使用的是opencode的Go套餐里面的具体介绍我之前文章写的详细https://mp.weixin.qq.com/s/4_cZOStFYJ-0qF8GOrv-cQ如果你要尝试Go套餐可以使用我的要求链接https://opencode.ai/go?refVH6HNYB1GE你和我都能获得5美元的Go额度。现在Go套餐里面的K3模型是显示2倍用量但我的用量依旧消耗的很快还用了好几个赠送额度。同时我也订购了火山方舟的Agent Plan里面也可以选择K3前面的文章也分享了这个不重复了思考AI发展真的很快我今年手写的代码很少大多数都是AI完成的。一些行业用时间成本换取薪水的模式或许正在走向终结。之前看到过一张图有点搞笑但又不无道理。当我们的技能变成一个个Skill 时我们还剩下什么呢还剩下 你的判断力、 你的信誉、 你的责任感、 你的随机应变能力…这些或许才是最后无法被蒸馏的东西。坦率地说没有什么是绝对安全的。AI 的发展速度已经超越了我们预测的精度。但与其在焦虑中等待被替代不如把 AI 当作一场倒逼我们进化的海啸。这场海啸会冲刷掉所有平庸的、机械的技能迫使我们去面对一个最核心的问题当机器可以做得比我们更好时生而为人的独特意义到底是什么这是一个没有标准答案的问题。未来已来你认为人类最后一道不可替代的防线到底在哪里我的回答人类最后不可替代的防线或许在于“意义的赋予”与“真实的联结”。