ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Kimi k3 “deepseek 2.0时刻”

2026/8/6 23:00:56 拓冰建站 浏览量
Kimi k3 “deepseek 2.0时刻” Kimi K3‌是月之暗面公司于‌2026 年 7 月 17 日‌正式发布的新一代 AI 大模型拥有‌2.8 万亿参数‌和‌100 万 token 上下文窗口‌是全球参数规模最大的开源模型已于‌2026 年 7 月 27 日晚‌正式开源模型权重与技术报告。k3的编程能力‌在 Code Arena 前端编程榜单中以‌1679 分‌登顶首位超过 Claude Fable 5 的 1631 分这是开源模型第一次在这个维度上反超顶级闭源。‌综合能力在 Artificial Analysis Intelligence Index 中获得‌57 分‌位列全球第三仅次于 Claude Fable 5 和 GPT-5.6 Sol马斯克也对kimi k3进行了称赞紧接着用户量的暴涨导致算力不足暂停会员注册这次的热度被称为deepseek 2.0时刻。一、核心特点1. 用更少的计算承载更大的模型Kimi K3总参数量达到2.8万亿但每次推理只调用约1040亿参数。相比所有参数都参与计算的传统稠密模型它能在扩大知识容量的同时控制计算量。相较Kimi K2K3的整体扩展效率提高约2.5倍。这意味着K3的提升不只是“参数更多”而是能够以更高效率利用这些参数。2. 从处理长文档升级到处理完整项目K3支持约100万token上下文是常见128K模型的近8倍、256K模型的约4倍。这使它不仅能阅读一篇长文档还可以同时处理大型代码仓库、多份研究资料和较长的工具调用记录。相比上下文较短的模型K3在长时间编程和跨文件分析中更不容易遗忘前面的要求。3. 从“生成代码”升级到“完成工程”传统代码模型擅长补全函数或生成单个文件但面对真实项目往往难以持续完成查看代码、修改文件、运行测试和修复错误的完整流程。K3更强调长程编程和工具操作。在Terminal-Bench 2.1中K3取得88.3分与GPT-5.6 Sol的88.8分接近在SWE-Marathon中取得42.0分高于GPT-5.6 Sol的39.0分和Claude Fable 5的35.0分。因此K3的主要突破不是“更会写代码”而是更接近能够独立推进项目的工程智能体。4. 从“回答问题”升级到“交付成果”K3能够连续搜索资料、分析数据、运行代码并最终制作报告、电子表格、网页或演示文稿。在AA-Briefcase办公任务测试中K3发布初期取得1543 Elo排名第二其分析质量Elo达到1754略高于Claude Fable 5的1744。不过K3的演示质量Elo为1471低于GPT-5.6 Sol的1660说明它在分析能力上更突出成果的视觉表达仍有提升空间。5. 同时理解文字和视觉信息K3能够直接理解图片、网页截图、图表和设计稿。相比先通过OCR提取文字、再由语言模型分析的传统方案它可以保留布局、颜色和空间关系。这让K3在网页复刻、界面操作和视觉编程中更具优势。发布后K3一度在Arena React代码榜以1694分排名第一显示出较强的前端生成能力。总体来看K3的超越主要集中在长程编程、多文件分析、工具调用和成果交付上并不意味着它在所有场景中都全面领先。以Arena通用文本榜为例K3 Max截至2026年7月29日以1486±10分暂列第11名其优势明显偏向复杂任务而非普通对话。二、背后的主要技术传统上把一个语言模型做大主要就是堆层数、堆参数。K3 的设计思路更立体它让信息沿着三个方向同时流动序列长度、网络深度、模型宽度。你可以把它想象成一栋楼长度是每层楼有多宽敞深度是楼有多少层宽度是每层能同时容纳多少个专业工种。序列方向上K3 用了一套混合注意力把三层 Kimi Delta Attention 配一层 Gated MLA三比一的比例贯穿整个网络。深度方向上一套叫 Attention Residuals 的机制让每一层都能回头看之前所有层的信息。宽度方向上每层注意力后面接一个 Stable LatentMoE从896个专家里每次只挑16个干活。右侧是主干每个 block 由三层 KDA 加一层 Gated MLA 组成暗红色的连线就是 AttnRes让每层能回看之前所有 block。左上是 Stable LatentMoE 的共享专家与路由专家左下是 KDA 模块底部是原生视觉通路 MoonViT-V2。1. KDA 混合线性注意力Kimi Delta AttentionKDA用于降低长序列的注意力计算成本。传统 Softmax 注意力处理 1M 上下文时KV Cache 会直接撑爆显存。K3 的方案是每个 Block 3 层 KDA 1 层 Gated MLA线性注意力把注意力成本从平方级压到线性级——不必每来一个新 token 就重翻全部历史只维护一个持续更新的笔记本KDA 更进一步给笔记本每一栏配了可学习的遗忘开关由模型决定哪些需要记住哪些需要遗忘Gated MLA全局注意力则周期性保留精确的全局检索能力防止细节丢失通过3 层 KDA 线性注意力 1 层 Gated MLA 全局注意力”的 3:1 组合将百万级上下文解码速度提升约 6.3 倍。2.Attention Residuals注意力残差常规的深层网络有个隐忧信息是一层一层顺着往上传的传到几十层之后最底下那层学到的东西可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传传到最后跟原话往往对不上。注意力残差让网络里每一个模块都能越过中间所有层直接回头去调取最初的输入、以及之前任意一个模块的输出。普通网络像流水线上的工人只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人随时能调出仓库里的原材料和之前任何一道工序的成品按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。AttnRes改善信息在深层网络中的传递减少模型层数增加后出现的信息损失Gated MLA通过压缩注意力中的键值信息降低KV缓存占用并利用门控机制动态控制信息传递。K3的93层网络中有69层使用KDA、24层使用Gated MLA从而兼顾长上下文效率和信息处理精度。3. Stable LatentMoE 超稀疏 MoEK3采用Stable LatentMoE混合专家架构总参数量达到2.8万亿但每个token仅激活约1040亿参数。模型设置896个专家每次只选择其中16个参与计算。相当于把一个巨大的模型拆成很多个专家子网络每次只唤醒其中几个来处理当前的输入。好比一家 896 人的会诊医院每个病人只安排 16 个最对口的专家出诊其他人待命。医院名义规模巨大但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因参数量做得极大但每个 token 实际激活的计算量被控制得很小。相比所有参数同时参与推理的稠密模型这种稀疏激活方式既能扩大模型容量又能控制计算成本。官方称其整体扩展效率较Kimi K2提升约2.5倍。4.原生多模态MoonViT-V2K3集成约4.01亿参数的MoonViT-V2视觉编码器将图片信息转换成模型能够理解的表示并与文字共同参与推理。相比“先用OCR识别文字再交给语言模型”的方案原生多模态能够保留图片中的布局、颜色和空间关系因此更适合网页截图复刻、图表分析、界面操作和视觉编程。总结K3 的最大意义不在于参数最大而在于验证了开源模型也可以在超长上下文智能体这个闭源最后的堡垒上掰手腕,让国产模型的优点不再只是便宜。