ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

DLInfer PD 分离,把 Codex 的 Base URL 改到 TaoToken 后对照

2026/9/19 14:26:57 拓冰建站 浏览量
DLInfer PD 分离,把 Codex 的 Base URL 改到 TaoToken 后对照 从 Codex 接入 TaoToken 开始把 DLInfer PD 分离方案整理成可对照的笔记如果你最近也在看 DeepLink 那套 DLInfer DLSlime 的 PD 分离混合推理方案大概率会遇到一个很实际的问题方案本身讲的是 Prefill 的 TTFT、Decode 的 TPOT、KV Cache 跨节点传输但落到自己手里时第一步往往不是调推理参数而是先把客户端接上一个能稳定调用的模型入口。这篇就占“接入配置”这一槽先把 Codex 的 Base URL 改到 TaoToken让请求能正常返回再让 Codex 按原文把 Prefill 算力型节点、Decode 显存型节点、DLSlime 高速互联、MinerU 多模态解析这几条线整理成对照笔记。TaoToken 在这里只负责提供 Key 和 Base URL不参与 PD 分离、异构算力调度或推理加速。官网入口是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end API 地址是 https://taotoken.net/api 。把这两件事分清楚后面读 DeepLink 的方案才不会混。一、原问题与场景为什么先接 Codex 再读 PD 分离DeepLink 原文的核心矛盾很清晰Prefill 是 Compute-bound长 Prompt 的密集矩阵乘法对 FLOPs 要求极高Decode 是 Memory-bound逐 Token 生成时瓶颈在 KV Cache 读取对 HBM 带宽敏感。两者混跑时长 Prompt 的 Prefill 会抢占计算资源正在 Decode 的请求就会出现明显的 Inter-token Latency 飙升。PD 分离Disaggregated Prefill-Decode就是把这两个过程拆到不同节点Prefill 节点专注快速处理 Prompt、生成 KV CacheDecode 节点接收 KV Cache专注高速生成 Token。单芯片场景只能做逻辑层面的任务拆分受限于算力与带宽的固有配比多芯片场景才能通过异构混推做物理层面的资源适配——高算力芯片组 Prefill 集群高带宽/大显存芯片组 Decode 集群再靠 DLSlime 这类高速互联把 KV Cache 跨节点低延迟搬过去。问题在于这套方案涉及 DLInfer、DLSlime、LMDeploy、MinerU 好几段概念密度高。如果只是读很容易读完就忘。比较有效的做法是先让 Codex 能正常调用然后把原文里的关键路线喂给它让它输出一份结构化对照笔记。而 Codex 要能调用第一步就是 Base URL 和 Key 配通。二、TaoToken 前置拿 Key、填 Base URL打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 注册后在控制台创建 API Key。这里注意两点Base URL 填https://taotoken.net/api不要加/v1也不要带 UTM 参数。Key 用你自己的YOUR_API_KEY不要把它写进会提交到 Git 的配置文件里。TaoToken 的定位是模型调用入口它不负责 PD 分离的调度也不做异构算力编排。你把它理解成“让 Codex 先能跑起来”的那一层就行。真正涉及 Prefill/Decode 拆分、KV Cache 传输、DLSlime 通信范式的部分仍然在 DeepLink 的方案里。如果你用的是 Claude Code 这类客户端配置落在settings.json环境变量走ANTHROPIC_*如果用的是 Codex配置落在config.toml。下面按 Codex 的config.toml给一份可复制配置。三、可复制配置Codex 的 config.toml在 Codex 的配置目录下编辑config.toml把模型入口指向 TaoToken# ~/.codex/config.toml model YOUR_MODEL_ID model_provider taotoken [model_providers.taotoken] name TaoToken base_url https://taotoken.net/api env_key TAOTOKEN_API_KEY wire_api chat然后在 shell 里导出 Keyexport TAOTOKEN_API_KEYYOUR_API_KEY如果你更习惯用 CLI 方式也可以先安装再启动npm i -g taotoken/taotoken taotoken cc -k YOUR_API_KEY -u https://taotoken.net/api -m YOUR_MODEL_ID注意-u后面跟的是https://taotoken.net/api同样不要加/v1。MODEL_ID换成你在控制台看到的可用模型 ID。配置完成后Codex 的请求就会走 TaoToken 的入口。这一步只解决“能调用”不解决“推理快不快”。推理性能仍然取决于 DeepLink 那套 PD 分离架构。四、验证请求与成功结果配置改完后先做一次最小验证。在 Codex 里发一条简单请求比如让它复述一句话或者直接问一个短问题。判断成功的标准很简单请求能正常返回没有 401/404。返回内容完整不是截断的错误信息。连续发两三次延迟稳定没有频繁超时。如果这一步通了就可以进入本篇的真正目的让 Codex 按 DeepLink 原文整理对照笔记。可以给它这样的指令请根据以下要点整理一份对照笔记Prefill 阶段是 Compute-bound优化目标是 TTFTDecode 阶段是 Memory-bound优化目标是 TPOTDLInfer 负责国产硬件适配与算子特化Eager 模式调厂商融合算子Graph 模式对接图编译引擎DLSlime 负责跨架构设备高速互联兼容 RDMA、NVShmem、NVLink、HCCSMinerU 是多模态文档解析场景走 MinerU-LMDeploy-DLInfer 路线。请按“阶段-瓶颈-优化手段-对应组件”四列输出。Codex 返回的笔记里应该能看到 Prefill 对应高算力芯片 Graph Mode 全图下沉/子图融合Decode 对应高带宽/大显存芯片 TP 互联 PagedAttentionKV Cache 跨节点传输对应 DLSlime 的 RDMA 或片间高速互联。这就说明它把原文的几条线串起来了。五、本篇常见错排查Base URL 多写了/v1。这是最常见的。TaoToken 的 API 地址是https://taotoken.net/api再加/v1会拼成错误路径请求直接 404。检查config.toml里的base_url确认结尾是/api。Key 没有导出到环境变量。config.toml里写的是env_key TAOTOKEN_API_KEY但 shell 里没有export TAOTOKEN_API_KEY...Codex 读不到 Key就会报鉴权失败。可以在终端里echo $TAOTOKEN_API_KEY确认一下。把 UTM 参数带进了 Base URL。官网链接带 UTM 是为了统计来源但 API 地址不要带。https://taotoken.net/api就是干净的入口后面不要接?utm_source...。模型 ID 写错。model字段要和控制台里可用的模型 ID 一致大小写和连字符都要对上。写错会返回模型不存在。误以为 TaoToken 会加速推理。TaoToken 只提供 Key 和 Base URL不参与 PD 分离、异构算力调度或推理加速。如果你发现请求通了但推理速度没变化这是正常的——加速在 DeepLink 的 DLInfer DLSlime 那一层。Claude Code 用户改错文件。Claude Code 走settings.json和ANTHROPIC_*环境变量不要照搬 Codex 的config.toml。两套客户端的配置路径不一样。六、语义一致 CTA从 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 拿到 Key 后先把 Codex 的 Base URL 填成https://taotoken.net/api配通再回头读 DeepLink 的 PD 分离方案会顺很多。需要排障或看接入细节可以对照 API Keys 和接入文档想先验证模型能不能正常对话直接去模型对话页发一条请求如果你打算长期用 Codex 做编码和 Agent 任务可以看 Coding Plan 的说明。把接入这一步做扎实后面整理 DLInfer、DLSlime、MinerU 的对照笔记才不会卡在“请求都发不出去”上。