ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

edge0-35b 还是 edge0-8b?两大 MoE 模型档位对比:如何为你的设备选对推理模型

2026/10/4 16:10:40 拓冰建站 浏览量
edge0-35b 还是 edge0-8b?两大 MoE 模型档位对比:如何为你的设备选对推理模型 edge0-35b 还是 edge0-8b两大 MoE 模型档位对比如何为你的设备选对推理模型【免费下载链接】Edge0项目地址: https://gitcode.com/gh_mirrors/ed/Edge0edge0是一个开源的流式 MoE 推理框架随框架发布了两个可直接运行的模型档位旗舰档edge0-35b与轻量档edge0-8b。两者的核心区别在于35b 参数更多、能力更强而 8b 内存占用更低、生成速度更快。本文用一张参数对照表 真实基准数据帮你 3 分钟选对适合自己设备的推理模型。一、先搞懂这两个模型档位是什么edge0 的卖点是SSD 专家卸载 prerouter 路由预测MoE 模型的大多数专家权重常驻磁盘按需流式加载因此峰值内存由激活的专家集合决定而不是总参数量——这正是 35B 级模型能跑进消费级设备的原因。两个档位各自是端到端的完整发布基础权重 LoRA 适配器 训练好的 prerouter 头下载即用edge0-35b旗舰档。基于 Qwen3.6-35B-A3B40 层、每层 256 个路由专家 1 个常驻共享专家路由宽度 K44-bit 量化检查点约23 GBedge0-8b轻量档。基于 Ling 3.0 混合架构MLA MoE约 7.9B 总参数 / 约 1.2B 激活参数24 层、每层 128 个路由专家路由宽度 K84-bit 量化检查点仅约4.2 GB。详细规格可查阅docs/models/edge0-35b.md 和 docs/models/edge0-8b.md。二、edge0-35b vs edge0-8b 核心参数对照表 ⚖️项目edge0-35bedge0-8b参数规模35B 级8B 级≈7.9B 总 / ≈1.2B 激活层数4024第 0 层为稠密层路由专家数256 1 共享128 1 共享路由宽度 top-k48路由方式softmax → top-k → 重归一化sigmoid 分组约束 top-k专家量化4-bitgroup 644-bitgroup 64检查点大小≈23 GB≈4.2 GB磁盘占用大需要 30 GB 空闲空间更稳妥小手机也能轻松装下一句话总结35b 用少而精每 token 只激活 4 个专家8b 用宽而快每 token 激活 8 个专家。两者的专家权重都不进内存、全部按需从磁盘流式读取。三、速度实测谁更快官方基准Mac mini M4 Pro / 24 GB数据来自 README.md 的 Benchmark 章节档位解码速度Prefill 吞吐冷/热峰值激活内存edge0-35b14.9–17.7 tok/s113 / 140 tok/s≈2.9 GiBedge0-8b23.9–25.3 tok/s500 / 1428 tok/s≈1.0 GiB解读8b 的解码速度约为 35b 的 1.5 倍峰值激活内存只有 35b 的三分之一不到两者峰值激活内存都很低2.9 / 1.0 GiB因为权重放在 SSD 上按需加载瓶颈在磁盘读取而非内存首次请求冷缓存会比热请求慢——专家权重需要从 SSD 换入。内存较小的机器可给 8b 加--prefill-ondemand参数让 27-token 的 prompt 只读 ≈0.42 GiB 专家而不是整个 4.1 GiB 检查点冷启动从约 5.3 s 降到 0.6–1.1 s。四、质量对比35b 的智商高多少官方用 OpenCompass 在同一设置下对比了 edge0 管线int4 训练好的适配器 prerouter 路由与原始 fp16 基础模型edge0 管线的质量损失很小35b 平均仅差 3.9 分8b 平均差 2.8 分基准edge0-35b (int4)Qwen3.6-35B (fp16)edge0-8b (int4)Ling 3.0 tiny (fp16)AIME 202686.692.763.373.3HumanEval90.995.191.592.7GPQA-Diamond79.881.870.771.2MMLU-Pro81.084.670.165.8IFBench57.961.753.960.6平均79.283.269.972.7解读数学/推理差距明显AIME 上 35b 领先 8b 约 23 分复杂推理任务请选 35b代码生成两者都强8b 的 HumanEval 91.5 甚至接近 35b90.9轻量写代码选 8b 足够MMLU-Pro 上 8b 反超自家 fp16 基座4-bit LoRA 管线的精度保持得很好。五、按设备选型快速选择指南 不同平台的官方设备要求与实测表现你的设备推荐档位依据MacM1–M4/ 内存 16 GB两个都能跑追求质量选 35b峰值激活内存仅 2.9 GiB瓶颈在 SSD 读取内存 16 GB 级、页缓存装不下检查点edge0-8b配--prefill-ondemand冷启动可快约 5 倍Android8 GB RAMedge0-8b8 GB 即可运行 8B详见 android/README.mdAndroid12–16 GB RAMedge0-35b参考机骁龙 8 Elite / 16 GB实测 35B 解码 6–9 t/s池预算 2–6 GBiPhoneiOS 17日常选 8b旗舰机可用 35biPhone 16 Pro 实测8B 约 7.2 tok/s35B 约 4.9 tok/s见 ios/README.md选型口诀内存紧张 / 手机 / 追求流畅→edge0-8b速度约 25 t/s磁盘仅 4.2 GB复杂推理 / 数学 / 长任务且设备内存 ≥12 GB→edge0-35b能力平均高约 10 分磁盘约 23 GB磁盘空间 30 GB 的手机→ 优先 8b35b 打包后约 20 GB 会占用大量存储。六、选好之后三步跑起来 ✅以 PythonmacOS · Apple Silicon为例完整教程见 python/README.md# 1) 安装框架 cd python python3.12 -m venv .venv .venv/bin/pip install -e .[dev,fetch] # 2) 下载你选中的档位二选一适配器自动就位 .venv/bin/python scripts/fetch_models.py --tier edge0-8b --target-dir models # 或 .venv/bin/python scripts/fetch_models.py --tier edge0-35b --target-dir models # 3) 运行 .venv/bin/edge0 demo models/edge0-8b # 快速体验 .venv/bin/edge0 serve models/edge0-8b # 启动 OpenAI 兼容服务默认端口 8000iOS / macOS / Android / Windows 四个平台的桌面与移动端引擎均已开源各平台目录ios/ · macos/ · android/ · windows/均有独立的构建说明与实测数据。七、结论一句话帮你拍板 日常对话、写代码、追求速度 → 选 edge0-8b数学推理、复杂任务、设备给得起 12 GB 内存 → 选 edge0-35b。两者共享同一套流式 MoE 推理管线切换档位只需换模型目录无需改动任何配置。想深入了解架构原理可阅读 docs/architecture.md、docs/moe.md、docs/streaming.md 与 docs/prerouter.md。【免费下载链接】Edge0项目地址: https://gitcode.com/gh_mirrors/ed/Edge0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考