ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

一文厘清 UI-TARS-desktop 项目中 UI TARS Desktop 与 Agent TARS App:定位、架构、模型与选型指南

2026/9/10 14:41:34 拓冰建站 浏览量
一文厘清 UI-TARS-desktop 项目中 UI TARS Desktop 与 Agent TARS App:定位、架构、模型与选型指南 一文厘清 UI-TARS-desktop 项目中 UI TARS Desktop 与 Agent TARS App定位、架构、模型与选型指南【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI TARS Desktop 与 Agent TARS App 是 UI-TARS-desktopTARS多模态 AI Agent 技术栈中两条容易混淆的产品线前者是专为「GUI 桌面自动化」设计的原生桌面客户端后者则是面向「浏览器与研究类长任务」的通用 Agent 应用。本文以项目内的官方对比博客 difference-between-ui-tars-desktop-and-agent-tars-app.md 为骨架结合仓库源码与配置逐一拆解二者的本质差异、底层实现与互补关系帮你按任务类型、平台与模型约束做出正确的下载与选型决策。背景为什么同一项目下会有两款容易混淆的应用在 README.md 开篇的引言中TARS 被定义为「一套多模态 AI Agent 技术栈Multimodal AI Agent stack」并明确说明该仓库当前同时交付两个项目Agent TARS与UI-TARS-desktop。二者共用同一技术底座与开源生态名字都带「TARS」却服务于差异很大的任务形态UI-TARS Desktop是一个桌面应用基于 UI-TARS 视觉语言模型提供原生 GUI Agent 体验官方以本地local与远程remote的 Computer / Browser Operator 为主要交付形态Agent TARS是通用多模态 AI Agent 栈将 GUI Agent 与视觉能力带入终端、浏览器、文件系统与你的产品中主要交付 CLI 与 Web UI以及早期的桌面 App 预览版。社区反馈显示大量用户因为名字相近而误下载、误配置。官方博客专门为此撰写了澄清说明其动机原文明确指出UI TARS Desktop 与 Agent TARS App 的混淆源于文档对两者角色阐释不清本文将精确还原官方结论再补上源码级证据。需要说明关联博客成文时 UI TARS Desktop 处于 v0.0.8 时代。当前仓库内 apps/ui-tars/package.json 的版本号已迭代到0.2.4Desktop 也随之加入了 Browser Operator 等能力。阅读本文时请把「博客描述的快照」与「仓库当前实现」区分看待二者的核心差异定位并未改变。先看结论两张表看懂核心差异官方博客速览表维度UI TARS DesktopAgent TARS App本质执行 GUI Agent 任务的原生桌面应用基于 agent MCP tools 的 Agent 应用核心模型仅支持 UI-TARS 视觉语言模型当时以 Claude 为主不支持 UI-TARS 模型支持平台Mac 与 Windows当时仅 Mac适用场景基于 GUI 控制电脑桌面自动化浏览器操作与自动化研究类任务能力来源UI-TARS 模型的视觉理解与动作输出Agent 框架的规划执行 MCP 工具生态仓库当前实现对照维度UI-TARS DesktopAgent TARS仓库代码位置apps/ui-tarsElectron 应用multimodal/agent-tarscore / cli / interface 等当前版本0.2.4见 apps/ui-tars/package.jsoncore 与 cli 均为 0.3.0见 core/package.json、cli/package.json模型要求UI-TARS 系 VLM含 UI-TARS-1.5、Doubao-1.5-UI-TARS面向通用 LLM/Agent 编排官方预告称基于 Claude 测试主要交付形态Mac / Windows 桌面安装包CLI、Web UI早期以桌面 App 预览形式发布UI TARS Desktop为 GUI 桌面自动化而生的客户端定位与本质UI TARS Desktop唯一的使命就是作为 GUI Agent 执行任务你输入一句自然语言指令它通过视觉理解屏幕上的界面输出点击、输入、滚动、按键等 GUI 动作序列代替人类操作电脑。它本质上是 UI-TARS 视觉语言模型的官方桌面客户端——README.md 的表述是「基于 UI-TARS 模型的、提供原生 GUI Agent 的桌面应用」。也因此官方将 GUI Agent 定义为一种以界面视觉为核心理解对象的智能体范式原始博客引用 arXiv 论文 2411.18279 给出该术语的学术出处模型并不依赖可访问性树或坐标注入而是直接「看懂」屏幕截图这与后面要讲的 Agent TARS 的通用工具编排路线有本质区别。版本、平台与运行前提支持平台Mac 与 Windows博客成文时点。安装方式Mac 上拖拽安装并需在「系统设置 → 隐私与安全性」中授予**辅助功能Accessibility与屏幕录制Screen Recording**权限Windows 直接运行安装包。详细步骤见仓库内 docs/quick-start.md。使用前提进行 GUI 桌面控制需要本地权限配合若要使用其 Browser Operator 模式需要预先安装 Chrome、Edge 或 Firefox 之一docs/quick-start.md 中明确标注。模型兼容性只认 UI-TARS 系的「动作协议」博客特别强调 UI TARS Desktop模型兼容性仅限 UI-TARS 模型。这不是产品限制而是架构使然Desktop 依赖 UI-TARS 系 VLM 输出专有的 GUI 动作格式再由项目内的动作解析链路解释执行。从 apps/ui-tars/package.json 的依赖可以清楚看到这条技术链ui-tars/action-parser —— 解析 UI-TARS 模型输出的 GUI 动作 ui-tars/electron-ipc —— Electron 主进程与渲染进程的动作通道 ui-tars/operator-nut-js —— 桌面级输入控制Computer Operator 的执行层 ui-tars/operator-browser —— 浏览器自动化执行层Browser Operator ui-tars/sdk / ui-tars/shared / ui-tars/utio —— SDK、共享工具与可观测上报其中ui-tars/operator-nut-js表明 Computer Operator 的底层基于 nut.js 这套跨平台桌面自动化方案实现鼠标键盘与系统级操作而ui-tars/action-parser则负责把 VLM 返回的文本动作翻译成可执行指令。也就是说换掉动作协议等价于换掉模型这正是 Desktop 无法轻易接入任意第三方模型的原因。对应的模型接入方式在 docs/quick-start.md「Get model and run local operator」一节中有完整实操示例典型配置如下以 Hugging Face 托管 UI-TARS-1.5 为例Language: en VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https:xxx VLM API KEY: your_api_key VLM Model Name: xxxVolcEngine 上的豆包系模型同样走 UI-TARS 协议Language: cn VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328官方同时给出两条硬性注意事项原文以 [!NOTE] 标注同样适用于其他兼容端点Provider 必须选择对应的 UI-TARS 专用项否则 VLM 动作解析可能失效Hugging Face 端点的 Base URL 必须以/v1/结尾模型名以端点页面展示为准。此外UI TARS Desktop 除本地运行外还提供远程RemoteOperator形态。README News 显示 v0.2.0 引入了 Remote Computer Operator 与 Remote Browser Operator。不过 docs/quick-start.md 也声明官方远程 Operator 服务已于 2025-08-20 停止试用需要自托管时可参考火山引擎VolcEngine的 Computer Use Agent / Browser Use Agent 部署入口自行搭建。适用场景小结UI TARS Desktop 擅长的是系统级 GUI 自动化操作桌面软件、打开并填写应用、跨窗口完成业务流程等「人类直接面对屏幕」的任务。它的回答方式是「动手做」而不是「搜索写报告」。若追求稳定与即装即用还应留意官方在 docs/quick-start.md 中的提示当前仅支持单显示器场景多显示器配置可能导致部分任务失败。Agent TARS App面向浏览器与研究任务的通用 Agent定位与本质Agent TARS App 于 UI TARS Desktop 之后发布见同目录下的发布公告博客 announcing-agent-tars-app.md。它的定位从「专用 GUI 执行器」转向了「通用多模态 AI Agent」利用 Agent 框架完成任务规划task planning与执行execution并借助 MCP 生态串联浏览器、搜索、文件、命令行等真实世界工具最终整合信息产出结论。换句话说UI TARS Desktop 回答的是「怎么点」Agent TARS App 回答的是「先去搜什么、看完得出结论、把结果写成文件」。版本、平台与模型平台博客成文时 Agent TARS App仅支持 MacWindows 支持计划在后续 beta 版本中提供且欢迎社区贡献。模型官方在 [!IMPORTANT] 提示块中特别强调Agent TARS 当时不支持 UI-TARS 模型Claude 是其临时最佳选择关于模型支持的最新进展以项目 GitHub Discussion #377 线程为准。配套的发布公告页 announcing-agent-tars-app.md 亦有相近表述规划链路基于 Claude 测试OpenAI 支持尚不稳定并欢迎社区共建。核心能力拆解来自发布公告与配置源码根据 announcing-agent-tars-app.mdAgent TARS App 的核心体验可归纳为四块Agentic Workflow Orchestration通过 Agent 框架编排「搜索 → 浏览 → 逐链接探索 → 信息综合」的长链路任务并以 Event Stream 与前端 UI 实时同步过程Comprehensive Tool Support面向 Deep Research、Operator 类任务执行复杂浏览器操作同时基于 Model Context ProtocolMCP接入 search、文件编辑、CLI、编码等大量工具Real-time Artifact以流式界面实时展示浏览器、文档等多模态产物是用户观察 Agent 过程并与之交互的重要入口Human in the Loop任务运行过程中可随时通过顶部输入框插入新的思考指令中途改变 Agent 的工作方向。使用前需要在设置页完成Model Provider / API Key与Search Provider / API Key两组配置Azure OpenAI 还可额外配置apiVersion、deploymentName、endpoint。线程分享支持两种模式Local Html把整条线程打包成可离线分发的 HTML 文件Remote Server Url则向用户指定的远端服务器以POSTmultipart/form-data上传 HTML bundle并从返回体的data.url字段取得可分享链接。从源码看 Agent TARS 的能力构成当前仓库中的 multimodal/agent-tars/core 完整承载了 Agent TARS 的核心逻辑是理解其与 Desktop 差异的最佳证据Agent 基座是通用 MCP Agent核心类AgentTARS直接继承自tarko/mcp-agent的MCPAgent见 agent-tars.ts并通过环境向父类注入 MCP 服务注册表environment.getMCPServerRegistry()。这解释了为什么 Agent TARS 不依赖 UI-TARS 的专有动作协议——它走的是「通用模型规划 MCP 工具执行」路线。能力被组织为多个 Environmentenvironments/local 下分别有 browser含浏览器控制策略、导航 / 内容 / 截图 / 状态等工具集、filesystem文件系统工具管理与 search搜索工具三组执行环境另提供aioSandbox全隔离执行环境选项。浏览器控制策略是分层可选的在 browser-control-strategies 目录中可看到browser-visual-grounding-strategy视觉定位、browser-hybrid-strategy混合与browser-dom-strategyDOM三种策略。值得注意的是构造时调用的validateBrowserControlMode(options.model?.provider, ...)见 agent-tars.ts会根据模型 Provider校验并调整浏览器控制模式——从源码结构看这正体现了「不同模型在视觉落点能力上差异显著」这一 Agent TARS 生态的既有认知。WebUI 配置体现任务形态默认 Web UI 配置 webui-config.ts 中的欢迎卡片按Research、AI Browser、CodeAct、MCP等分类组织示例任务例如调研股票、查询网站备案、修复 Git 报错、绘制图表等与「研究 浏览器 代码 MCP 工具」的通用 Agent 定位一一对应该配置还暴露了 GUI Agent 子配置如截图渲染策略与调试用的 Event Stream 查看器开关。CLI 交付并存除桌面 App 外multimodal/agent-tars/cli 以agent-tars为 bin 提供命令行交付形态cli/package.json说明 Agent TARS 是「CLI Web UI App」多形态的整套 Agent 栈。适用场景小结Agent TARS App 适合长链条、研究型、浏览器密集型任务深度资料调研、竞品分析、多来源信息交叉验证、页面级操作配合命令行的复合工作流。它在执行中不断产出可回放的过程记录与结构化产物而不是单纯替用户点几下屏幕。一图看懂互补关系怎么选官方博客的总结可浓缩为一句话UI TARS Desktop 用于系统级 GUI 自动化本地/远程操作你的电脑Agent TARS 聚焦浏览器与研究工作流。二者并非升级替代关系而是互补的两条产品线选择时可以按三个维度快速决策你的核心需求推荐应用决策依据操作本地桌面软件、跨窗口 GUI 流程UI TARS Desktop原生 GUI Agent直接接管鼠标键盘支持 Mac/Windows用自然语言「帮我调研 / 分析 / 整理报告」Agent TARS浏览器 搜索 文件 CLI 的长链路编排依赖 UI-TARS / Doubao-1.5-UI-TARS 系模型UI TARS Desktop仅此客户端提供专用 VLM 动作协议支持只使用浏览器内的自动化网页操作、页面级 AgentAgent TARS或 Desktop 的 Browser OperatorDesktop 亦已具备 Browser Operator可结合自身模型倾向选择你的运行环境是 Windows 且想用 Agent TARS 桌面形态需等待官方 beta博客明确 Windows 支持计划在 Agent TARS 后续 beta 中提供几点选型提醒看模型再下载如果你手头已部署/购买了 UI-TARS 系模型的端点Hugging Face、VolcEngine 或自部署请务必选择 UI TARS DesktopAgent TARS 并不消费 UI-TARS 模型的专用动作输出。看平台再下载Agent TARS 桌面形态发布初期仅 MacDesktop 则同时覆盖 Mac 与 Windows。看任务再下载短平快的「替我点一下」类任务属于 Desktop 的主场「帮我写一份关于 X 的深度报告并保存到本地」则是 Agent TARS 的主场。关注版本演进仓库迭代速度较快Desktop 已从 v0.0.8 演进至 0.2.4能力边界持续扩展官方博客文末也预告会持续统一与增强两款应用的功能。正式选型前建议以 README.md 的 News 栏目与各 Release 说明为准。常见误区 FAQQ1Agent TARS 是不是 UI TARS Desktop 的新版本不是。Agent TARS 是一个独立定位的通用 Agent 产品线与 Desktop 并行存在于同一仓库从首版起就定位为浏览器/研究型任务 Agent。Q2我能在 Agent TARS 里跑 UI-TARS 模型吗在当时博客成文时间点不可以——官方明确说明 Agent TARS 不支持 UI-TARS 模型Claude 是临时最佳选项而 UI-TARS 系模型恰好只能被 Desktop 充分发挥动作解析能力。Q3Desktop 能换成 Claude 来驱动吗不可以直接替换。Desktop 的 GUI 动作依赖 UI-TARS 系模型输出的专有协议需要action-parser链路配合见 apps/ui-tars/package.json 依赖换用其他模型会破坏动作解析这也是它在 Provider 配置上强制限定 UI-TARS 专用项的原因。Q4两个都要装吗如果你的工作流既包含桌面 GUI 自动化、又包含深度浏览器调研那么它们可以各司其职、互补使用——这正是官方所称「unique purposes and target different scenarios」的完整含义。延伸阅读官方对比博客原文difference-between-ui-tars-desktop-and-agent-tars-app.mdAgent TARS 发布公告功能与配置详解announcing-agent-tars-app.md项目总览与两条产品线定义README.mdUI TARS Desktop 安装与模型接入步骤docs/quick-start.mdUI TARS Desktop 设置项说明docs/setting.mdUI TARS SDK 说明构建 GUI 自动化 Agent 的跨平台工具链docs/sdk.mdAgent TARS 核心实现MCPAgent 基座与环境注册agent-tars.tsAgent TARS 浏览器控制策略与 WebUI 配置multimodal/agent-tars/core/src/environments/local/browser/browser-control-strategies、webui-config.ts【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考