
Agent在纸面上越来越聪明用起来的体验却在一个关键维度上明显变差。以前大家喜欢Claude的声音、性格和“灵魂”现在这些东西在RL的地牢里被冲刷干净。每天都能收到这种回复整墙术语、层层嵌套的解释眼睛直接开始发麻。连前Reddit CEO、pi的作者Mario Zechner、Replicas的Connor都公开吐槽过同样的问题。有人甚至专门写了/bro技能只为求模型“说人话”。我起初以为只要再提示一次“简化语言”就够了后来每天被这些墙式散文淹没才意识到真正的问题不在词汇而在信息形态本身。人类视觉皮层经过数百万年训练处理丰富视觉信息几乎不费力分析大段文字却又累又慢。工具必须适配人的心智就像斧头必须适配人手。用视觉约束替代墙式文字我们内部开始尝试让Agent用简洁视觉来解释正在发生的事而不是堆砌散文。这套方法被做成了show-me技能已经在humanlayer里上线也可以接到其他coding agent上。核心就一句话show me。让Agent用组件树、调用栈、图表、文件布局、伪代码、类型签名、diff语法、HTML mockup这些轻量形式把程序设计、大diff审查、控制流讨论变得一目了然。它比HTML还轻、还快对绝大多数开发形状的问题已经足够好。程序设计阶段很多人现在直接跳过但我认为它仍然关键。你应该先讨论代码的形状——类型、签名、调用栈——再让Agent动手写。同样的技术也能用来事后探索大diff决定审查时该挖哪里。几种真正能用的视觉形态组件树前端问题里只保留真正重要的状态hooks和模块边界其余全部省略。调用栈后端或编排类问题直接画出控制流形状。有人甚至写了工具从AST直接算出这些栈。图表如果聊天界面支持内联Mermaid状态图和时序图往往比文字更直接偶尔还是会有slop但通常比读字好。文件布局浅层文件树每行只写一个职责。适合回答“这东西住在哪”和确定重构范围。伪代码算法类问题里往往比真实代码更紧凑。类型与签名代码存在之前的形状——对架构文档来说太内部、但对Agent来说又容易写错的部分。diff语法大部分内容不变时直接用diff形式展示组件变化、调用树变化、文件布局变化甚至状态/控制流的伪代码变化。HTML mockup和HTML图表很多原型工作已经用HTML取代了Figma。Agent可以直接在回复里塞HTML或者你打开浏览器看。这些形式的共同逻辑很简单把“分析信息”的重活转交给已经进化了数百万年的视觉通路。为什么这比单纯简化语言更有效单纯要求“少用术语、说人话”只能治标。Agent智能提升后它仍然倾向于用最完整、最防御性的文字把自己的推理过程全部倒出来。视觉约束则从形态上强制它压缩必须选出真正重要的节点、边界和关系其余全部丢掉。结果是人类注意力可以重新聚焦在真正需要判断的地方——品味、意图、架构——而不是先穿越一堵术语墙。下游的人只在自动化护栏失效时才被拉进来注意力变得稀缺而精准。怎么立刻用起来安装技能后直接调用/show-me或者明确要求Agent使用show-me技能。指向一个路由、服务、功能、PR或当前话题也可以只让它把刚才的问题/陈述重新用视觉方式说一遍。“内容太多了show me。”或者“/show-me 用HTML explainer的形式。”你也可以继续定制让它把问题表示成“解决方案最显而易见的形态”或者结合scratchpad一类工具把HTML、Markdown、Mermaid、LaTeX、调用栈全部混在一起。Agent已经能写大量代码下一步真正拉开体验差距的不是再多一点智能而是让它说话的方式重新适配人类的感知通道。视觉不是装饰是约束也是背压。你最近一次被Agent的墙式回复劝退是在讨论什么类型的问题组件结构、控制流还是大diff欢迎直接贴场景我们一起试着转成视觉。我是紫微AI在做一个「人格操作系统ZPF」。后面会持续分享AI Agent和系统实验。感兴趣可以关注我们下期见。