ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Strata 多显卡进阶:Layer Split层分割让双卡流水线推理再快18-20%

2026/10/1 23:32:32 拓冰建站 浏览量
Strata 多显卡进阶:Layer Split层分割让双卡流水线推理再快18-20% Strata 多显卡进阶Layer Split层分割让双卡流水线推理再快18-20%【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/StrataStrata 是一个让 125B 参数 MoE 大模型 Qwen3.8-Flash-Next 跑在 8GB 显存显卡上的本地推理引擎Windows / Linux 一键安装并自带 OpenAI / Anthropic 兼容 API。它的进阶能力 Layer Split层分割可以把同一张 PC 里的多张 NVIDIA 显卡串成流水线一张卡算前半段网络层另一张卡算后半段prompt 读取速度在双卡下提升 18-20%解码速度与最快单卡持平甚至更高。什么是 Layer Split一次说清层分割流水线很多人听说多卡第一反应是张量并行——把一层矩阵切成几块分给几张卡需要 NVLink 高速互联。Strata 的 Layer Split 走的是另一条更亲民的路流水线层并行。把模型 48 层连续切成若干段第一张卡负责第 0 到 K-1 层第二张卡从第 K 层接手以此类推最后一张卡额外承担输出头和草稿MTP层。一个 token 每经过一个校验窗口才在卡间传递一次几百 KB走钉住内存而不是一层传一次。关键红利每张卡只为自己负责的层维护专家缓存。两张卡的专家缓存容量大约等于单卡的两倍。对 Coder 模型16 GB 24 GB 的一对卡几乎能装下全部热门专家——解码阶段就几乎不再碰 CPU 内存池这正是速度的来源。而且不需要 NVLink、不需要点对点直连插在 x4 甚至 x1 插槽的老卡都能用。为什么 prompt 提速最明显prompt你发过去的长文档、代码、历史对话是被切成块、逐块流过各张卡的第一张卡读完第 c 块时第二张卡已经在读第 c1 块——天然重叠互不等待。实测双卡把 16K-28K 的 prompt 读取速度拉高18-20%而解码速度与最快单卡打平、写代码场景还领先 4-7%。一键配置什么都不用敲安装向导自动选卡你不需要输入任何命令。运行START-HERE.batLinux 下./setup.sh它会列出你的 NVIDIA 显卡并逐张说明 Strata 能否使用它Your NVIDIA GPUs: GPU 0: NVIDIA GeForce RTX 5080, 16 GB VRAM - can be used GPU 1: NVIDIA GeForce GTX 1080 Ti, 11 GB VRAM - not supported ... GPU 2: NVIDIA GeForce RTX 3090, 24 GB VRAM - can be used 1) GPU 0 (RTX 5080, 16 GB) GPU 2 (RTX 3090, 24 GB) together (recommended) 2) GPU 2 (RTX 3090, 24 GB) only Which GPUs? [1]:有两张以上能分担模型的卡时向导会推荐两张最佳组合新一代卡自动成为主卡直接回车即可。单卡装的模型下次启动也会只问一次要不要双卡共用选择会被记住。手动指定显卡与切分点想自己决定时可以加参数--gpus的编号即nvidia-smi里的编号第一张是主卡参数含义--gpus 0,2这两张卡一起用选择会被记住--gpus all所有能分担模型的卡全部用上--gpu 0本次启动只用这一张卡--layer-split auto默认自动挑切分点也可手写如18或16,32也可以直接改现有配置strata-*.json再重启gpu: [0, 2], layer_split: auto哪些显卡组合不被支持比 RTX 20 系列更老的卡计算能力低于 7.5如 GTX 10 系显存不足 8 GB 的卡——多卡模式下每张卡都要放一份稠密权重和 prompt 缓冲区AMD / Intel 显卡以及 NVIDIA 与它们混插。完整规则见官方文档 docs/MULTI_GPU.md。auto 模式是如何算出最佳切分点的--layer-split auto会对每一种切法打分双卡/三卡时全枚举预测一次解码窗口的耗时选最快的那个。它的估算依据每层耗时按 SM 数量 × 频率估算例如 RTX 5080 约 0.33 ms/层缓存内容每张卡负责层里的热门专家按热度排序填充专家路由分布按 (r1)^-1.2 拟合实测命中率未命中惩罚装不下的专家要回 CPU 算按拟合值计入代价。启动日志会直接打印结论一目了然strata generate: layer split auto: K19 - the caches hold 11767 of 12288 profiled pairs strata serve: layer split: layers 0-18 (CUDA0), 19-47 (CUDA1), one hand-off per window在 RTX 5080 RTX 3090 上auto 选了 K22prompt 速度落在手工调优最优值K26的 0-12% 以内解码持平——普通用户放心选 auto 就对了。实测数据双卡到底快多少社区实测环境Ryzen 9 9950X3D / 62 GB DDR5 / Windows 11模型为 CoderIQ1_M 原生包48 层 × 256 专家32K 上下文。原始数据见 bench/results/2026-09-29-layer-split/README.md配置Prompt 16K / 28K (tok/s)解码 story / code (tok/s)5080 单卡1,726 / 1,97083-87 / 88-1055080 3090最佳切分 (K26)2,039 / 2,35784 /1105080 3090auto (K22)2,037 / 2,07380 / 109三个结论Prompt 收益最大18-20%两张卡各读各的层读下一块时不互等解码与最快单卡打平、写代码反超当两张卡的缓存合计能装下几乎全部被路由到的专家后瓶颈变成每层 GPU 时间正确性有保证单卡结果与 0.1.20 版本逐字节一致卡间交接本身是比特级精确的。切分点 K 怎么选扫一遍你就懂了K 即主卡负责前 K 层。实测 K 从 18 扫到 32切分 KPrompt 28K (tok/s)解码 code (tok/s)专家命中率181,694103.899.9%222,074106.499.8%262,357109.799.3%282,287112.599.0%322,063108.798%规律很直白K 太小快卡5080活儿少、慢卡3090层数多拖后腿K 太大快卡缓存装不下自己的热门专家命中率下滑。对这套卡 Coder甜区在K26-28。要不要再加第三张卡大多数情况下不要。实测把 RTX 2080 Ti 作为第三张卡加入 5080 3090解码掉到 68 / 90 tok/s比双卡还慢——每多一张卡每个窗口就多一次层间往返。只有当两张快卡装不下模型大部分路由专家更大的模型时第三张卡才回本。另外记住一条排序原则最快的卡放第一位auto 会按缓存容量给它分尽量多的层。双卡下哪些功能依旧可用很多人担心分卡会砍掉功能——实测答案是主流功能全部跨卡可用详见 bench/results/2026-09-29-layer-split-limits/README.md️图片输入--vision每张卡各自维护图像位置表⚡控制向量 / 实验性 speed projection每张卡各存一份表按请求同时开关KV 流式--kv-resident每张卡流式传输自己会话的 KVprompt 中途检查点--prompt-cache-every每张卡读完自己的块就存下那部分。小结你想知道的答案需要 NVLink 吗不需要x4 / x1 插槽都行配置麻烦吗向导自动选卡 auto 自动切分零命令提升多少Prompt 18-20%解码持平、写代码 4-7%显卡门槛每张 RTX 20 系及以上、≥8 GB 显存卡越多越好不是装下专家的两张够快慢卡反而拖速如果你有 64 GB 内存和两张 RTX 20 系以上的卡git clone https://gitcode.com/gh_mirrors/strata11/Strata后直接双击START-HERE.bat回车接受推荐组合就能白拿这 18-20% 的 prompt 提速。【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考