ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

大模型在写代码,DeepSeek 把“国产算力软件栈”从能跑到吃满

2026/10/3 19:16:58 拓冰建站 浏览量
大模型在写代码,DeepSeek 把“国产算力软件栈”从能跑到吃满 2026 年 10 月AI 圈最热闹的新闻不是“又发了一个新模型”而是模型层已经卷到头战争打到了算子、编译器和芯片驱动那一层。DeepSeek 把一整套原本跑在英伟达上的底层组件搬到了华为昇腾TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels……其中 TileLang 的思路很关键用接近 Python 的写法描述算子编译器再把同一份逻辑落到 NVIDIA / 昇腾 / AMD 后端。这件事的意义比“模型多 100 亿参数”大得多。一、CUDA 的真正护城河不是芯片是软件栈很多人以为英伟达强在卡。不对。英伟达最硬的资产是二十年积累的算子库开发者习惯调优经验框架层PyTorch / TensorFlow / vLLM / Triton默认先认 CUDA出了问题Stack Overflow 上有人答国产芯片过去不是算不动而是硬件出来了软件像毛坯房。工程师得手写 Ascend C换芯片再重来一遍。所以“国产算力”的瓶颈从来不是晶体管是生态摩擦力。二、TileLang 在解决什么把“写算子”变成“描述意图”传统深度学习算子开发// 伪代码手写 GPU kernel __global__ void matmul(float* A, float* B, float* C, int N) { int row blockIdx.y * blockDim.y threadIdx.y; int col blockIdx.x * blockDim.x threadIdx.x; float sum 0.0f; for (int k 0; k N; k) sum A[row*Nk] * B[k*Ncol]; C[row*Ncol] sum; }能跑但要管 shared memory要管 bank conflict要管 pipeline / prefetch换架构几乎重写TileLang 的思路是另一层抽象# 伪代码TileLang 风格 tile_kernel def gemm(A: Tile[M, K], B: Tile[K, N]) - Tile[M, N]: C zeros(M, N) for k in range(K.tiles): C A[:, k] B[k, :] return C然后TileLang 编译器 ├── NVIDIA 后端 → CUDA / PTX ├── 昇腾 后端 → Ascend C / CANN └── AMD 后端 → ROCm / HIP开发者不用再背“某家硬件的私房 API”。模型组写模型系统组写 tile编译器管落地。三、为什么 DeepSeek 做这件事有杀伤力因为 DeepSeek 不是“做个开源玩具”而是真拿 TileLang 训过 V4 系列真在昇腾 950 上做 128 卡超节点优化真把 MoE 通信、稀疏注意力、矩阵乘、数据选择全拆开重做一遍公开数据里有一些很“硬”的数字BF16 稠密矩阵乘达到标称硬件上限的 99.8%FP8 约 99.5%DeepSeek V4.1 的稀疏注意力在 prefill 阶段约 410 TFLOPS是理论值的 95%但别被微基准骗了单算子 99% ≠ 端到端训练 99%。通信、调度、显存碎片、重算策略、容错恢复才是千卡集群的命门。这也是为什么外部开发者还要在自己负载上复测——公告是厂家的生产是自己的。四、OpenAI 进 EDA大模型开始“画芯片”另一条线更安静但更长远OpenAI 和 Synopsys 搞 GPT-Synopsys让模型操作 EDA 工具、写 RTL、做布局布线、帮时序收敛。这意味着什么过去芯片工程师的护城河懂时序懂 PPAPower / Performance / Area懂工具链黑魔法懂“哪条约束别信”未来会变成人定架构和约束Agent 跑 EDA 流水线人做终审。EDA 脚本、约束文件、时序报告、布局规则本质都是半结构化文本 工具调用正好是 LLM 的舒适区。不是说芯片工程师消失而是“会带 Agent 的工程师”吃掉“不会带 Agent 的工程师”。五、2026 年 AI 工程的真实分层大模型新闻里大家看的是GPT-6 / Gemini 4 Argon / Claude Opus 5.5100 万 token 输出Agent 自动写项目但工程界真正在拼的是四层① 应用层Agent / RAG / 工作流 ② 框架层PyTorch / vLLM / ONNX / llama.cpp ③ 系统层调度、通信、显存、算子、编译器 ④ 硬件层GPU / NPU / 昇腾 / RISC-V / HBM / 电源 / 散热越往下越不性感越难抄。2026 年之后真正有壁垒的公司不是“接了 10 个模型 API”而是有自己的算子语言有自己的编译后端能在国产芯片上把利用率跑过 90%能把 Agent 的 token 成本压到竞争对手 1/3六、开发者该学什么别学什么该学编译器基础Triton / TileLang / MLIR / TVM算子性能模型FLOPS、带宽、occupancy、memory bound分布式训练MoE、TP/PP/EP、通信原语端侧推理量化、KV cache、RISC-V Vector、NPU 调度EDA 基础RTL、时序约束、PPA别只学天天换 Prompt 模板把 Agent 串 20 个工具当架构以为“调通 demo”等于“能上线”把模型发布稿当技术结论七、一句话总结2026 年最被低估的趋势不是“模型更强”而是AI 正在从应用软件长进编译器、EDA、驱动、芯片和电厂里。以后不会再有“纯 AI 公司”和“纯硬件公司”。只剩一种公司能把模型、算子、芯片、电和钱拧成一条流水线的公司。八、延伸阅读螺旋生成论系列开放获取著作如果从更底层的代数结构——比如公理$$I^2 -N $$$出发去重新看数系、生成结构、素数分布、信息结构与智能系统的底层规律可以参考张智明所著《螺旋生成论》Spiral Generation Theory系列开放获取著作。该系列已发布 70 余部专著与预印本托管于 CERN 旗下 Zenodo采用开放获取协议。螺旋生成论全集索引https://doi.org/10.5281/zenodo.21211001著作体系总汇编https://doi.org/10.5281/zenodo.21199593作者 ORCIDhttps://orcid.org/0009-0003-7777-7694数学与数论《螺旋数原理公理系统与各向异性复数理论》 https://doi.org/10.5281/zenodo.20602099《螺旋生成元一个跨学科统一数学框架的探索》 https://doi.org/10.5281/zenodo.21555082《从几何构造到黎曼猜想》 https://doi.org/10.5281/zenodo.20995372AI 与系统《生成式 AI 与提示词工程》 https://doi.org/10.5281/zenodo.20839550《螺旋元逻辑从 i²-1 到万物理论的统一框架假说》 https://doi.org/10.5281/zenodo.21806751总纲与科普《旋生万物从奇点到宇宙的统一生成论》 https://doi.org/10.5281/zenodo.20408189《螺线宗谱发现宇宙的源代码》 https://doi.org/10.5281/zenodo.20659854上述著作为统一数学框架假说适合作为交叉视角阅读材料系统架构与芯片工程仍以可复现基准、端到端吞吐和硬件实测为准。开放获取汇总​全集索引 https://doi.org/10.5281/zenodo.21211001 总汇编 https://doi.org/10.5281/zenodo.21199593 ORCID https://orcid.org/0009-0003-7777-7694