ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

WorkBuddy双模型限免实测:Hy4 preview与Hy3选型与配置指南

2026/9/7 16:16:16 拓冰建站 浏览量
WorkBuddy双模型限免实测:Hy4 preview与Hy3选型与配置指南 最近打开 WorkBuddy 翻了一眼模型列表发现多了个入口Hy4 preview。再习惯性看一眼公告栏这次确实有点意外——双模型限免直接安排上了Hy4 preview 开放限免体验两周Hy3 的免费窗口更是直接拉到了 9 月底。这种“新老模型一起放开”的操作对 WorkBuddy 用户来说是一个值得抓住的时间窗口。我自己的 WorkBuddy 工作台已经跑了一段时间了从最初只是拿它当“高级问答框”到后来接连接器、配 Skill、写自定义指令慢慢把它变成了一个每天都在用的效率中枢。这次 Hy4 preview 和 Hy3 同时限免我刚好利用这个机会在两个模型之间反复切换做对比测试也顺手把限免期常见的问题摸了一遍底。这篇就把我的实测体会、选型思路和配置经验整理出来给准备上车或者还在观望的同学做个参考。1. 先搞清楚 WorkBuddy 解决的是什么问题1.1 它不是又一个聊天机器人很多人第一次接触 WorkBuddy 时第一反应是“这不就是个 AI 对话工具吗”。站在聊天这个功能上看这个理解不算错但远远不够。WorkBuddy 真正的定位是效率智能体、个人工作台核心不是陪聊而是把一整套工作流程里需要人工反复操作的环节拆成可由 AI 驱动、可配置、可自动执行的任务流。打个比方普通 AI 对话好比是你请了一个顾问你问一句他答一句WorkBuddy 是把这个顾问放进了你的办公室里让他能看你的日程、读你的文档、帮你整理表格、定期跑一遍检查清单甚至通过连接器去更新某个业务系统里的数据。顾问还是那个顾问但“能干活”和“能聊”是两个完全不同的层次。另外WorkBuddy 的部署方式也和单纯在线聊天工具不一样。它支持本地部署也就是说你的对话记录、知识库、自定义指令这些相对敏感的东西可以跑在自己的环境里。对有数据合规要求的团队来说这个能力往往是决定用不用的第一优先级。1.2 Skill、连接器、自定义指令三个概念先理清要在 WorkBuddy 里把双模型限免用出价值首先得理解它的三个核心概念。Skill技能可以理解为给 AI 预置的一套专业知识加操作流程。比如你装了一个“周报生成”Skill那 AI 在帮你写周报时就知道该调用哪些数据、按什么结构组织、用什么样的语气输出。没有 SkillAI 是全科但平庸的实习生配了 Skill它就成了熟悉你们部门规则的熟练工。连接器Connector负责让 WorkBuddy 和外部系统通信。钉钉多维表、Obsidian、企业微信、各类数据看板都是通过连接器接进来的。连接器解决的是“AI 能知道什么”的问题——它不只是靠预训练知识回答你而是能去真实的工作系统里读取最新数据再基于这些数据做分析或生成内容。自定义指令Custom Instructions这是你直接告诉 AI 的做事规矩。比如“所有回复控制在300字以内”“先给结论再给过程”“涉及金额时标注风险项”。一套好的自定义指令比盲目换大模型提升效果来得更快。这三个东西的关系可以这么理解连接器负责延长 AI 的手Skill 负责武装 AI 的大脑自定义指令则是在给 AI 立规矩。三者配合好了再叠加上合适的模型整个工作台的效率才会真正起来。我见过不少人拿到 WorkBuddy 之后直接开始聊天连连接器都没配过那其实只发挥了这个工具不到两成的能力。2. 双模型限免到底送了什么2.1 Hy4 preview两周窗口主要给尝鲜和验证用Hy4 preview 的限免时间是两周。对于一款模型来说预览版通常意味着它具备新一代架构的能力但在稳定性、边界行为、兼容性上可能还没完全打磨到正式商用水平。选择在这个时间点开放限免一方面是想让用户提前体验新能力并收集反馈另一方面也是在真实场景里做压力测试。两周时间看似不长但对个人用户来说足够做一次完整的评估了。我建议在这两周里不要只拿它闲聊而是把你日常最高频的三到五类任务分别跑一遍。怎么跑记录四个维度就行输出质量、响应速度、指令遵循程度、出错率。我自己的方式是把这些记录丢在一个专门建的任务队列里每做完一类就对比一下。两周下来你就能判断正式版出来之后Hy4 preview 值不值得作为主力付费使用。另外提醒一句预览版的限免通常和正式版的定价是两套逻辑。别因为限免期用起来爽就默认以后都免费那基本不可能。真正的价值在于趁免费先把效果测明白等收费的时候你心里有数。2.2 Hy3免费到 9 月底适合踏实当主力Hy3 作为上一代模型最大的优势是稳。它经历过完整的上线周期各类边界情况都被磨过一遍在常规任务上的表现有比较稳定的预期。这次直接把免费窗口拉到 9 月底给了用户非常充裕的时间去把 WorkBuddy 的工作流搭起来不用一边搭一边算调用成本。对还在观望的新用户来说Hy3 其实就是最好的入门模型。不确定什么任务该用什么模型的时候选 Hy3 基本不会翻车。等把工作流跑顺了再尝试把特定环节切到 Hy4 preview 上对比一下这个策略最省钱也最省心。我特别想强调的是Hy3 在限免期内适合干一件事把你的自动化流程全部建好。因为工作流这种东西需要反复调试调一次跑一次都会消耗模型额度。如果在 Hy3 免费期把这些都调通了等活动结束再评估要不要继续用或者要不要升级到 Hy4 preview决策成本会低很多。2.3 怎么确认自己已经用上了限免额度很多人在 WorkBuddy 里看到模型列表有 Hy4 preview 和 Hy3但不确定自己到底有没有用上或者担心超了会被收费。以我实测的经验可以从三个地方确认。第一是模型选择器。在对话或任务配置界面看当前选中的模型名称是否显示为 Hy4 preview 或 Hy3。限免期内这两个选项前端一般会带“限免”“免费”之类的标识没有标识的话建议去官方公告里确认一下活动规则。第二是用量页面。在账户的用量或配额页面查一下调用记录限免期内的调用通常会单独标记。如果显示的是限免额度就不会计入付费账单。第三是实测验证。切到 Hy4 preview 后用一个平时回答起来比较套路的问题去测一下感受响应风格的差异。再切回 Hy3 对比如果输出风格和推理路径明显不同说明切换生效了。需要提醒的是限免政策随时可能调整建议在活动期间把关键任务都跑一遍别把“限免”当成“永久免费”来依赖。3. Hy4 preview 与 Hy3 的选型别只盯着“新不新”3.1 Hy4 preview 强在什么地方从我这几天的对比测试来看Hy4 preview 给我最明显的感受是复杂指令的遵循能力更强。同样是让它“读一遍文档提取其中的风险点并按严重程度排序输出成表格”Hy4 preview 在步骤拆分和格式执行上更不容易丢环节。Hy3 有时候会漏掉“按严重程度排序”这个要求或者表格结构写得不够规整需要你再回炉一次。在多轮对话的长上下文处理上Hy4 preview 的稳定性也更好。我测试过一次让它连续处理三份有部分重叠的会议纪要要求做去重合并。Hy3 在第二轮开始会出现记忆偏差把前面已经处理过的内容重复输出Hy4 preview 在这方面的表现干净很多基本能准确判断哪些信息已经在前面出现过、哪些是新内容。不过预览版也有它的小脾气偶尔会在某些边界问题上给出比较固执的回答。我的经验是做创造性内容、复杂分析、长文档处理时优先用 Hy4 preview做日常问答、模板化输出、需要一次就成的任务时Hy3 反而更省心。新模型强在处理复杂任务但在简单任务上并不一定比老模型有优势有时候还会因为想得太多而导致输出啰嗦。3.2 Hy3 的价值被很多人低估了大家都在追新模型但 Hy3 在限免期内其实是被低估的存在。那些你每天都要跑、跑了很多遍、几乎可以预判输出形态的任务比如周报整理、待办提取、邮件草拟交给 Hy3 完全够用而且胜在稳定、不出幺蛾子。与其用新模型在这种重复任务上浪费宝贵的预览额度不如把 Hy3 当成默认选项把 Hy4 preview 留给真正需要高级推理的场景。打个比方Hy3 像是用了两年的老朋友他的能力边界你摸得很清楚重要事情交给他放心Hy4 preview 像是刚来的新同事脑子确实更快但你还不完全清楚他在压力下会怎么反应。重要程度低、频率高的任务交给老朋友重要程度高、难度大的任务让新同事上这大概就是最合理的分工。还有一个容易忽略的点模型的稳定性直接影响到你工作流里下游任务的可靠性。如果你的自动化流程里AI 的输出要作为下一步的输入那“稳定可预期”比“偶尔惊艳”重要得多。一个格式忽好忽坏的模型哪怕单次效果再好也会给你的流程带来大量返工。从这个角度看Hy3 在限免期内的价值被大多数人低估了。3.3 我目前使用的分配策略我现在的工作台里是这么分配的任务类型首选模型原因日常问答、信息查询Hy3响应快、稳定、成本可控周报、日报整理Hy3模板化输出不需要过度推理长文档摘要、知识库问答Hy4 preview长上下文处理能力更强复杂数据分析、多条件任务Hy4 preview指令遵循和多步拆解更好创意写作、方案框架构思Hy4 preview生成质量更高套话更少定时自动执行的任务Hy3保证流程稳定优先当然这只是一个参考实际要怎么分得看你的业务类型。关键在于平时就养成按任务分模型的习惯而不是打开工具随便选一个就开跑。任务类型不同的底层逻辑是简单任务求稳定复杂任务求能力批量任务求成本。模型切换的成本几乎为零多动一下手指省下的是后面反复调整的时间。4. 把限免期变成生产力实操配置指南4.1 模型切换的几种方式WorkBuddy 里切换模型有不同的入口我常用的有三种。第一种是全局默认模型。在设置里指定一个全局模型所有新建的对话和任务只要不单独设置就默认走这个模型。适合业务场景比较单一的用户设置一次就不用管了。第二种是单对话切换。在每个对话的模型选择器里单独切换适合同一段时间内需要和不同模型并行协作的场景。比如我经常同时开两个对话一个用 Hy3 整理待办一个用 Hy4 preview 分析文档互不干扰。第三种是任务级指定。在配置自动化任务时为每个任务单独指定模型。这是我最推荐的方式因为任务一旦固定下来模型选型也应该固定。不要指望一个模型能适配所有任务把不同任务的模型选型固化到配置里才是长期效率最大化的做法。我的习惯是全局默认选 Hy3然后把需要 Hy4 preview 能力的长文档处理、复杂分析类任务单独指定。这样既不会在简单任务上浪费新模型的额度也能保证复杂任务优先享用更好用的模型。4.2 用好 Skill 和自定义指令模型才有用武之地模型只是发动机要让 WorkBuddy 跑起来还得配好 Skill 和自定义指令。以我自己搭的“客户反馈分析”工作流为例连接器定时从反馈表里拉取新增数据Skill 负责把反馈按产品线分类、提取高频问题、识别情绪倾向最后再通过自定义指令要求输出时带上“问题等级标注”和“建议下一步动作”。这套流程跑通之后每周能省下我差不多两三个小时的人工整理时间。没有 Skill 和连接器的话这些数据你只能手动复制粘贴给 AI哪还有什么效率可言。自定义指令方面我强烈建议花点时间打磨。一个基础的指令模板大致包含四块角色定位你是什么身份、任务规则输出格式、语气、长度限制、边界约束哪些内容不处理、输出要求先结论后细节、用表格等。拿我常用的一条指令举例你是一名项目助理负责整理团队例会纪要。规则只提取与本周任务相关的信息忽略寒暄和无关讨论输出格式为 Markdown 表格包含任务、负责人、截止日期、风险标注四列如信息缺失标注“待确认”而不是猜测输出控制在200字以内。指令写得越具体模型输出的质量就越稳定。这一点在 Hy3 上体现得尤其明显——指令清晰的时候Hy3 的表现完全不输给 Hy4 preview。反过来如果你指令写得含糊再强的模型也救不了。4.3 本地部署和连接器需要注意的几个点如果你打算把 WorkBuddy 部署在本地环境里跑有几个经验值得分享。算力规划要留够余量。本地部署意味着推理资源自己出如果是自建机器内存和显存最好按模型的建议配置再往上留一截。不然并发任务一起来响应延迟会非常明显本来一个几秒的任务被拖到半分钟体验大打折扣。连接器鉴权提前准备。接钉钉多维表、Obsidian 这类系统时大多数连接器都需要配置 token 或应用凭证。建议提前去对应平台的开发者后台把密钥申请好省得配置到一半卡住或者为了等一个审批拖上两天。我第一次配钉钉连接器时就是没提前申请权限结果流程跑到一半被卡住后来把权限补上才跑通。目录结构保持清晰。WorkBuddy 的工作区、知识库、日志目录尽量分开。日志和临时文件如果全部堆在默认目录里后面排查问题会很痛苦。尤其是做自动化任务比较多的时候日志文件增长很快不分开管理的话半个月就能把你目录搅成一团乱麻。版本升级前先备份。如果通过命令行或脚本方式更新升级前对配置目录做一次完整备份。模型能力在迭代工具本身也在迭代遇到版本不兼容的时候有个回滚点会安心很多。别问我怎么知道的有一次升级后 Skill 配置读不出来了幸亏备份及时不然全部重新来一遍的滋味不好受。5. 这几天实测遇到的坑与排查方法5.1 模型切换后没生效有几次我在一个对话里切成 Hy4 preview但后续对话的输出风格还是一股 Hy3 味。排查下来发现旧的消息上下文还挂在对话里模型是在原上下文基础上继续回答的。遇到这种情况最简单的办法是先开一个新对话再切换模型。如果新对话里模型选择器显示正常基本就没问题了。另外还有一个细节有些设备会在后台做模型列表的缓存刚更新版本或者刚开放新模型时列表里可能看不到 Hy4 preview。这时候不要反复重装软件先试试下拉刷新模型列表或者清理一下客户端的缓存数据重新登录。多数情况下是缓存问题不是账号问题。5.2 限免额度显示异常活动刚上线那两天不少用户在用量页面看到的数据和实际体验对不上。我的处理方式是先看模型选择器上的标识再跑一次特征明显的任务验证。如果确认实际在用的是限免模型就不必太担心显示问题。当然如果长时间不刷新可以重启客户端或者重新登录一次让配额信息重新同步。这里多提一句如果你在用量列表里看到某个模型出现了一条“0.00”的记录不用担心那一般就是限免额度的抵扣记录。随手截图保存一下也行万一后面账单有异议手里有凭证比空口解释省事得多。5.3 自定义指令在部分任务里不生效这个问题我踩过几次。后来发现原因是有些任务模板里自带了系统提示词把我写的自定义指令给覆盖了。解决办法是不要把所有规则都堆在自定义指令里对于关键任务直接在任务描述里把最重要的约束写清楚。比如“输出必须是表格含一列风险等级”直接在任务文本里写比只依赖全局自定义指令更靠谱。优先级可以这么记任务描述覆盖自定义指令自定义指令覆盖模型默认行为。搞清楚这个顺序之后遇到“指令没生效”的情况先检查这个任务是不是走了一个自带提示词的任务模板。如果是把关键要求写进任务描述里即可。不要试图用一个全局自定义指令管所有任务那既不现实也不好维护。5.4 连接器同步异常用连接器做定时同步时偶尔会遇到同步失败或者数据不同步。经验是先看连接器的日志确认是鉴权过期、接口限流还是字段映射变化。如果是鉴权过期去对应平台重新授权就行如果是接口限流把同步频率降下来就好如果是字段映射变化得去更新映射配置。这类问题通常不是 WorkBuddy 本身的问题更多是外部系统接口变动引起的别一上来就重装工具。我还习惯给每个重要的自动化任务做一次最小化验证先用两条假数据手动触发一遍看输出是否符合预期再放到生产环境里定时执行。这个习惯帮我避免了不少半夜被任务异常叫醒的情况。连接器这种跨系统的东西最大的风险就是“这边看着没问题那边已经断了很久”定时验证能把这个空窗期缩短到最小。另外补充一个观察如果同一时间有多个连接器都开始执行同步任务很容易撞上外部系统的限流阈值。建议把定时任务的执行时间错开几分钟别让所有任务都挤在整点跑。这个细节我在最开始没注意后来把同步时间从“每小时整点”改成“每小时第15分钟、第35分钟、第55分钟”同步成功率明显提高。模型限免是好事但基础设施不稳再强的模型也白搭。这次双模型限免我最大的体会是工具在变模型在迭代但真正决定效率上限的还是你有没有把工作流理清楚。限免期是很好的试错窗口别光顾着“白嫖”新模型的体验趁着这段时间把 WorkBuddy 的 Skill、连接器、自定义指令都配置到位把任务分清楚模型才是把这波福利变成长期生产力的正确姿势。最后再分享一个小技巧限免期建议你每周固定抽半小时把当周用到的所有任务类型过一遍看每个任务用哪个模型效果最好记录成一个“模型选型表”。等限免一结束免费的额度收回去了你手上的这份实测记录才是真正有价值的东西。到时候要付费也付得明白不付费也知道该怎么降级替代心里完全不慌。