ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

书籍规则对AI真的有效吗?agent-rules-books 74分对46分的重构A/B实验深度解析

2026/10/2 6:53:39 拓冰建站 浏览量
书籍规则对AI真的有效吗?agent-rules-books 74分对46分的重构A/B实验深度解析 书籍规则对AI真的有效吗agent-rules-books 74分对46分的重构A/B实验深度解析【免费下载链接】agent-rules-booksAGENTS.md rules / skills for AI coding agents: Codex, Cursor Claude Code. Inspired by Clean Code, Refactoring, DDD, Clean Architecture and DDIA programming books.项目地址: https://gitcode.com/gh_mirrors/ag/agent-rules-booksagent-rules-books 把《重构》《代码整洁之道》《领域驱动设计》等经典编程书蒸馏成可直接加载的AGENTS.md 书籍规则供 Codex、Cursor、Claude Code 等 AI 编码代理使用。这个项目做了一场74 分对 46 分的重构 A/B 实验同一份代码、同一个评审模型只是喂规则的方式不同——一组拿到具体规则清单一组只拿到一句请遵守《软件设计哲学》。结论很直接对 AI 来说把书里的原则拆成可执行规则比只报书名有效得多。一、争议起点给AI喂书名它真的会照做吗如果你用过 AI 编码代理可能试过在 AGENTS.md 里写一句OBEY Clean Code / Refactoring / A Philosophy of Software Design听起来很对但质疑声一直存在——模型训练时大概率读过这些书写不写这句话产出的代码会不会有差别docs/CRITICISM.md 里收录了社区对此项目的批评其中排名最靠前的一条就是没有清晰的改进度量有效性评分 9/10。作者没有回避而是直接安排了一次对照实验来回答这个问题。二、实验设计同一本书两种喂法 实验对象是一个故意vibe coding生成的客服 CLI 项目vibe-coded-crap用 Codex GPT-5.4 mini连续 80 个任务堆出来的代码库专门用来测试不同 AGENTS.md 在重构流程中的表现。实验聚焦一本书A Philosophy of Software Design《软件设计哲学》核心思想是对抗复杂性、做深模块、隐藏信息。两条分支对同一应用做重构对比项️ mini 规则组️ 只报名人组注入内容本仓库的 a-philosophy-of-software-design.mini.md 完整规则集仅一行 AGENTS.md 指令OBEY A Philosophy of Software Design by John Ousterhout生成重构计划同模型先产出 PLAN.mdreasoning extra high同左完全一致执行重构同一模型reasoning high同左完全一致评审方式ChatGPT 盲评哪份代码更好地实现了该书原则好多少同左设计的巧妙之处在于只改一个变量规则以具体清单还是一句书名的形式进入上下文。计划生成、执行模型、推理强度全部对齐避免混淆因素。三、结果解析74 分 vs 46 分差距藏在哪里盲评结果mini 规则组约 74/100只报名人组仅 46/100。但更有意思的是第二项测量——作者又跑了 Reek 代码异味静态扫描测量维度原始代码mini 规则重构后结论Reek 异味总数10831077几乎没差 ❌ChatGPT 原则符合度评分—74 vs 46差距显著 ✅这组反向证据恰恰是关键规则的红利不在原始异味计数上——静态分析看不出 6 个异味的差别差距体现在架构判断力上模块深度、职责边界、信息隐藏、读者一次需要理解多少代码这些只有懂设计的人或模型能评估的维度。换句话说书籍规则改变的不是代码有没有明显坏味道而是重构的审美方向和判断质量。四、为什么列规则比报名名更有效mini 规则文件 的结构说明了原因。它不是书摘而是一份工程作业约定分三层Decision rules决策规则比如优先做深模块小而语义化的接口隐藏内部复杂性拒绝纯透传服务、薄封装——这是模型知道书名时未必会主动调用的具体判断标准Trigger rules触发规则比如每新增一个模块、wrapper、参数先证明它隐藏的复杂性大于它引入的复杂性——把原则挂到了具体动作上Final checklist收尾清单交付前逐条自检这次改动是否降低了理解、修改、验证系统的成本。打个比方 让一个实习生遵守《代码整洁之道》和递给他一张命名不超过三个名词、函数只做一件事、删掉不用的参数的清单效果显然不同。模型知道知识 ≠ 模型执行知识显式的上下文提醒把隐含知识拉回了决策面上。这也回应了 docs/CRITICISM.md 中LLM 可能本来就懂这些书的质疑作者的态度是——模型或许知道原则但未必能稳定应用而一份短小的、改变决策的提醒而不是全书级上下文正是价值所在。五、理性看待这是早期信号不是基准测试项目方在 README.md 中明确给出了边界声明值得引用该结果应视为早期定性信号而非 benchmark。更深入的测量和其他书的对照实验暂不计划——那需要大量 token 预算和人工评审时间。所以正确姿势是✅ 把它读作具体规则 模糊号召这个结论的初步证据✅ 注意差异主要在架构判断维度静态异味数几乎不敏感❌ 不要外推成加载任意书籍规则都能 28 分。六、新手上手三步把书籍规则用起来第 1 步 · 获取仓库git clone https://gitcode.com/gh_mirrors/ag/agent-rules-books第 2 步 · 挑一本书、用 mini 版仓库收录 14 本书的规则集每本都提供三档尺寸见 README.md 中的 Release Matrix档位定位典型场景full完整参考版如 DDD 全文 979 行深度审计、一次性深度会话mini推荐工作层约 40–65 行绝大多数日常任务、技能skill主体nano紧凑保底版约 35 行上下文预算极紧的常驻规则第 3 步 · 按需加载别全局堆叠按 docs/USAGE.md 的建议重构任务加载 refactoring.mini.md遗留代码改造加载 working-effectively-with-legacy-code.mini.md多书组合先查 docs/COMPATIBILITY.md。一次只挂一本主规则避免规则互相打架或挤占任务上下文。七、常见问题 FAQ ❓Q1这些规则是读书笔记吗不是。仓库刻意不复现书籍原文而是写成面向 AI 工具的工程作业指令定位是轻量级工作约定不能替代读原书。Q274 vs 46 的实验覆盖了所有书吗目前只测了 A Philosophy of Software Design 这一本其余 13 本没有同类对照数据。Q3规则会不会被模型忽略docs/CRITICISM.md 将此列为有效质疑8/10之一因此压缩流程_rule-workbench/PROCESS.md只保留真正改变模型决策的规则砍掉口号式条目。Q4Codex / Cursor / Claude Code 都能用吗可以。规则就是纯 Markdown可放进AGENTS.md、CLAUDE.md或转成技能文件编辑器专属配置细节见 docs/USAGE.md。写在最后这场实验最诚实的价值不在于 74 对 46 这个数字本身而在于它示范了一种对待 AI 规则的正确态度先怀疑再设计对照用盲评和静态分析双口径验证并公开承认证据边界。对于正在给 AI 编码代理配置规则文件的你它给出的可操作建议就一条——把遵守某某经典换成遵守这几条具体规则然后像这个项目一样用你自己的代码库做一次小 A/B。【免费下载链接】agent-rules-booksAGENTS.md rules / skills for AI coding agents: Codex, Cursor Claude Code. Inspired by Clean Code, Refactoring, DDD, Clean Architecture and DDIA programming books.项目地址: https://gitcode.com/gh_mirrors/ag/agent-rules-books创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考