ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

理解 DeepSeek Harness:为什么模型越来越强,还需要一层复杂的软件系统?

2026/8/16 7:44:20 拓冰建站 浏览量
理解 DeepSeek Harness:为什么模型越来越强,还需要一层复杂的软件系统? 最近 DeepSeek 开源了 DeepSeek Harness。单看功能清单它很容易被当成又一个 Agent 框架有模型、有 Tool、有 Skill、有 SubAgent、有上下文管理、有 Sandbox还有 Web UI。但这样的理解价值有限。真正值得研究的问题是为什么到了 2026 年DeepSeek、OpenAI、Anthropic 都开始认真建设模型外面的这套系统一个越来越强的大模型为什么还需要如此复杂的一层软件想清楚这个问题DeepSeek Harness 的代码结构、Codex 的 Agent Loop、Claude Code 的 Hooks / Skills / Subagents才会串成一条完整的技术演进路线。一、从一次函数调用到 Agent Loop最早的大模型应用非常简单用户给一段 Prompt模型返回一段回答。f(prompt) → response本质上就是一次函数调用。这种架构适合问答、摘要、翻译、文案生成、信息提取——但它有一个天然限制模型只能想和说无法真正改变外部世界。于是出现了 Tool Calling。比如模型发现我需要知道昆明今天的天气就会产生一次get_weather(昆明)调用。程序负责执行工具把结果交还模型模型继续作答。这一刻Agent 最原始的形态出现了理解 → 行动 → 观察 → 再理解。也就是经典的 Think → Act → Observe 循环。OpenAI 在解释 Codex 架构时同样把 Agent Loop 描述为连接用户、模型和工具的核心运行机制。图 1 Agent Loop思考 → 行动 → 观察循环直到任务完成把所有花哨概念拿掉一个 Agent 最基本的只需要五样东西目标Goal、大脑LLM、行动Tool、观察Observation再加上一个终止条件。写成伪代码就是while 任务未完成: 理解当前状态 决定下一步 执行动作 获取结果从这里能得出全文最重要的一句判断Agent 的智能主要来自模型Agent 的可靠运行主要来自 Harness。这两件事需要分开理解。二、Harness 到底是什么把一个 Agent 想象成一个非常聪明的人模型是他的大脑。但一个真正在干活的人还需要眼睛和耳朵、双手、电脑、记事本、过往经验、同事、办公环境、规章制度、工作日志。把这些一一映射到 Agent 系统就得到了 Harness 的全貌图 2 人类工作系统与 Agent 系统的对应关系所以 Harness 可以用一句话定义Harness 是围绕模型建立的一整套执行环境负责让模型能够持续、安全、有状态地完成真实任务。模型负责聪明Harness 负责让这份聪明落地。三、模型越强Harness 为什么反而越重要乍看有些反直觉模型越聪明软件逻辑不应该越来越少吗这个判断只对了一半。模型越聪明确实能省掉大量人写的判断规则。以前要写一长串if A ... elif B ... elif C ...现在一句请结合当前情况决定下一步就够了。但另一个变化同时发生模型能力越强 → 能承担的任务越复杂 → 能调用的能力越多 → 执行时间越来越长 → 对真实世界的影响越来越大 → 运行时治理越来越重要于是软件复杂度开始从业务判断逻辑迁移到Agent Runtime图 3 复杂度迁移从人写死的业务逻辑到模型驱动的动态决策过去工程师提前规定每一步必须干什么现在越来越多系统允许模型根据当前状态自己决定下一步。系统设计的重点随之改变——以前的关键问题是如何规定每一步以后的关键问题变成模型能看见什么能做什么在什么边界内做做错了怎么办如何知道它做过什么如何中断它如何恢复什么时候需要人介入这才是 Agent Harness 真正解决的问题。四、Claude Code 与 Codex早就在走这条路很多人用完 Claude Code 会产生一种感觉Claude 模型是不是突然变强了很多模型当然重要但 Coding Agent 的能力其实可以拆成三块LLM × Context × Tools跑在同一个 Agent Loop 上。Claude Code 官方把核心工作过程概括为三个阶段Gather Context → Take Action → Verify Results循环往复。它拥有文件操作、搜索、Shell、Web、代码智能等工具并在每次行动的结果之上继续决策。Anthropic 的 Agent SDK 说得更直接它运行的就是 Claude Code 所使用的那个自主 Agent Loop——Prompt → Claude → Tool Call → Tool Result → Claude → ……同时在外围加上权限、Hooks、上下文压缩Compaction、Session 和 Subagent。所以 Claude Code 的核心价值不能简单归因于Claude Bash。它已经是一套成熟的 Agent Runtime。Codex 也在走同一条路。OpenAI 把 Harness 描述为提供核心 Agent Loop 和执行逻辑的系统支撑 Codex CLI、Codex Cloud 和 VS Code 等不同产品形态。观察它的工程体系会发现越来越多东西进入这一层AGENTS.md、Skills、Sandbox、Approval、MCP、Hooks、Context 管理、Compaction、Multi-Agent。Codex 仓库甚至明确了 Context 工程原则上下文必须有界、避免频繁变化导致缓存失效、注入项需要硬上限。这透露出一个重要变化Agent 的竞争正在从单纯的模型竞争扩大为 Model Harness 的系统竞争。五、DeepSeek HarnessEverything is a Plugin有了前面的铺垫再看 DeepSeek Harness 就清晰多了。它没有重新发明 Agent而是提出了一种关于Harness 应该如何组织的强烈观点Everything is a Plugin。传统框架的形态是 Core Extensions中心是一个不可动的 Agent CoreAgent Loop、Memory、Tool Manager、Prompt 都在里面外围挂一些插件。而 DeepSeek Harness 基于 Cordis 构建把 LLM Adapter、Tool Registry、Session Log——连 Agent Loop 本身——全部做成了 Plugin。图 4 两种 Runtime 组织方式特权核心 vs 全插件化官方架构文档里有句很硬的话There is no privileged core to patch——没有需要打补丁的特权核心。所有扩展行为都通过挂载新的 Plugin 和事件扩展点完成。为什么要做得这么激进因为 Agent 的能力边界很难提前预测。今天需要 Tool、Skill、Memory明天可能需要 Computer Use、Browser、长期目标、Agent Team、人工审批、远程沙箱、后台任务、知识图谱……如果 Runtime 写成一个巨大的 AgentManager每出现一种新能力就要改一次核心很快就会膨胀失控。DeepSeek Harness 给出的答案是Agent 是一组运行时能力的组合结果。但这里必须保持审慎Everything is a Plugin听起来优雅可软件架构有个长期存在的规律抽象是有成本的。极端模块化会带来新的复杂度——调用链变长、调试变难、运行时行为更隐式、学习曲线更陡。第一次读它的源码并不轻松。同时还要警惕框架复杂度可能超过业务复杂度。对于用户 → LLM → 查数据库 → 回答这样的场景一个 LLM ↔ Tools 的简单循环完全够用引入完整 Harness 属于杀鸡用牛刀。更实用的思考框架是一条复杂度谱系图 5 Agent 复杂度谱系层级越高 ≠ 架构越好从 Level 1 的单次 LLM 调用到 Level 6 的多 Agent 分布式运行时每一层解决不同的问题。设计 Agent 系统时真正重要的问题不是怎么上到最高层而是当前场景需要走到哪一层层级越高并不天然代表架构越好。六、三种哲学一个共识把三个系统放在一起看会发现它们代表三种不同的哲学。系统哲学一句话更值得关注的设计点DeepSeek Harness打造可以组装各种 Agent 的 Runtime可组合性Claude Code打造越来越强的单个 Agent使用体验与扩展生态Codex从 Coding Agent 走向通用 Runtime安全执行LangGraph显式状态与流程编排确定性控制Claude Code 的哲学是增强一个强大的 Agent。中心始终是 Claude Agent 这个明确的主体CLAUDE.md、Skills、Tools、MCP、Hooks、Subagents、Plugins 全都在增强它。Anthropic 官方把这些能力放在基础 Agent Loop 之上Skills 提供可复用知识MCP 连接外部服务Subagents 用独立上下文执行任务Hooks 在生命周期事件里插入确定性逻辑Plugins 负责打包分发。DeepSeek Harness 的哲学是Runtime 本身可重组。连 Agent Loop 都只是一个可替换实现——官方文档明确区分了稳定的 Agent 接口和默认的 Agent Loop 实现。它想打造的是一个可以组装各种 Agent 的 Runtime。Codex 处在一个很有意思的中间位置。一方面有明确的 Agent Loop另一方面不断吸收 Sandbox、Approvals、Skills、Hooks、Multi-Agent、Memory、Remote Execution正在从 Coding Agent 演进为 General Agent Runtime。但如果把产品名字全部拿掉会发现它们正在收敛到同一个结构图 6 收敛中的共识Agent 时代的应用运行时标准形态这张图可能比任何一个具体框架都重要。因为它已经开始像Agent 时代的应用运行时标准形态Context、Tools、Skills 喂给 Agent LoopSession、Permission、Hooks 负责状态与治理往下是执行环境旁边是 SubAgents。七、Agent 架构的五个演进方向方向一: 模型和 Harness 会越来越分离未来模型类似 CPUHarness 更接近操作系统。同一个 Harness 可以切换 DeepSeek、Claude、GPT、Gemini而模型越来越依赖 Harness 获得真实世界能力。长期看Model 和 Agent Runtime 会成为两个相对独立的技术层。方向二: Agent 会越来越长时间运行早期 Agent 跑几秒Coding Agent 跑几十分钟未来企业级 Agent 可能跑数小时、数天甚至持续运行——AI 运维工程师、AI 项目经理、AI 客户经理。这时核心问题就从回答得好不好扩展为状态如何保存、任务如何恢复、失败如何重试、人何时介入、如何处理外部事件。这也是 Session、Event Log、Job、Goal、Schedule 这些传统软件概念重新大量进入 Agent Runtime 的原因。方向三: Context Engineering 成为核心基础设施Agent 的智能上限很大程度取决于模型知道什么。Context 会从拼 Prompt升级成完整系统System Instruction、对话、文件、Memory、Skill、RAG、Tool Result、用户画像、当前目标……Harness 必须决定什么信息进入、何时进入、以什么格式、保留多久、何时压缩、何时丢弃。Codex 的上下文硬约束和 Claude Code 的自动 Compaction 都说明——Context 已经成为独立的工程问题。方向四: 控制权成为架构真正的核心理解权、规划权、路由权、执行权、终止权——这五种控制权可以在 LLM、程序、规则、人之间分配。成熟的 Agent 系统很少把所有控制权都交给模型理解与规划给 LLM高风险审批给人权限判断给 Policy命令执行给 Runtime超时终止给程序。Claude Code 和 Codex 越来越复杂的权限与 Sandbox 体系正是在回答这个问题。方向五: 多 Agent 的价值会被重新定义未来有价值的 Multi-Agent不是Agent A 和 Agent B 聊天而是上下文隔离、能力隔离、权限隔离、并行执行、专业化分工。Claude Code 的 Subagent 是最好的例子一个 Subagent 拥有自己的 Context Window、System Prompt、Tools 和 Permissions完成后只把结果交还主 Agent。SubAgent 的核心价值其实是上下文隔离——这比模拟一个专家角色重要得多。八学习 DeepSeek Harness 的正确姿势到这里才能比较客观地评价 DeepSeek Harness。它目前最值得学习的有四点把 Agent 看作 Runtime 问题。认真解决 Session、Context、Execution、Permission、Sandbox、SubAgent、持久化而不停留在 Prompt Tools。极强的能力解耦意识。Service Definition、Provider、Consumer 的能力接缝设计对大型 Agent 平台如何避免能力耦合很有参考价值。Event Log 作为状态基础。Session 被设计成 append-only 事件日志模型消息从日志投影得到Fork、Resume、Replay、遥测都围绕它建立。Agent Loop 本身可替换。对未来探索 Workflow Agent、Planning Agent、长期运行 Agent 很有启发。它同样有明显风险目前仍是 Developer Preview官方明确提示后续存在破坏性变更。插件化是否过度、Cordis 学习成本是否值得、复杂事件链能否保持可调试性、生产环境相对更简单 Runtime 的收益究竟多大——这些问题都不能因为架构漂亮就提前下结论。所以学它的目标不该是学会 DeepSeek Harness而是借它看清 Agent Runtime 正在变成什么。最终你应该形成一张自己的认知地图图 7 Agent 架构认知地图智能 × 运行时 × 治理有了这张地图面对任何 Agent 框架都可以用同一套问题去审视它如何管理 Context如何组织 Agent Loop如何定义 Tool如何保存状态、处理中断和恢复如何做权限和沙箱隔离SubAgent 怎么用如何做可观测和审计哪些控制权交给模型哪些保留给程序和人做到这一点之后无论下一个流行的是 DeepSeek Harness、Claude Agent SDK、Codex、LangGraph 还是 OpenHands你看到的都会是同一句话同一个 Agent 架构问题的不同解法。这才是研究这些开源项目最有价值的地方。