ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

渐进式披露评估计划:为 book-to-skill 建立可证伪、低成本的 Agent 实验体系

2026/9/10 13:48:38 拓冰建站 浏览量
渐进式披露评估计划:为 book-to-skill 建立可证伪、低成本的 Agent 实验体系 渐进式披露评估计划为 book-to-skill 建立可证伪、低成本的 Agent 实验体系【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill本文基于仓库内 docs/research/progressive-disclosure-evals.md 规划文档展开并结合 tools/discovery_tax.py、tools/evals/ 下的已实现评估工具及其测试系统讲解 book-to-skill 如何把一篇长上下文 Agent 论文的发现转化为可验证的因果实验。读完本文你将掌握评估计划要回答的核心问题、论文结论的适用范围与边界、因果可分离的实验设计规则、运行成本纪律、13 个任务PD-00 至 PD-12的完整规格以及每个任务在仓库中的落地代码、测试与验收方式。1. 背景从建模上下文成本到测量真实 Agent 轨迹book-to-skill 的核心主张是把技术书 PDF 转化为 Claude Code 技能skill让 Agent 在工作时以更低的上下文成本完成研读—引用—应用。仓库现有的 tools/discovery_tax.py 已经用真实抽取的书籍文本量化了三种策略回答单个定向问题所需的上下文 token 量context-dump——整本书常驻上下文每一轮都被重新计费discovery-loop——实时 PDF 阅读 Agent 先读目录ToC再按需拉取原始章节找不到定义时还会回溯到前一章book-to-skill——小型常驻SKILL.md核心 按需加载的一份预编译章节。该工具的诚实性说明见 tools/discovery_tax.py 文件头 docstring非常重要token 计数优先使用 tiktoken 的cl100k_base真实 BPE 编码未安装时退化为words/0.75启发式并在报告中打印所使用方法count_tokens/token_method见 tools/discovery_tax.pydiscovery-loop 的数字是一个带明确假设的模型而非某个具体 Agent 的测量值它使用书籍真实的 ToC 与章节大小因此是有依据的估计而不是猜测报告同时给出最佳情形ToC 目标章节与循环情形ToC 目标章节 为缺失定义回溯的上一章两组数字。这正是评估计划存在的理由discovery 数字是模型不是真实 Agent 轨迹的测量。因此下一步不是再宣称省了多少 token也不是再加一个生成功能而是一套小型的、用证据说话的评估系统能够回答Agent 是否找到了正确的来源 / 书籍 / 章节到达正确材料后表示representation是否真的有助于答案Agent 实际使用了哪些文件与工具一次运行在 token / 调用次数上的成本是多少在相同条件下某个提议的改动是否真的优于现有行为只有当这些测量完成后论文启发的想法才有资格改变生产环境的SKILL.md行为。2. 论文结论边界支持什么、仍开放什么评估计划引用的论文He 等人《Is Progressive Disclosure All You Need for Long-Context Agents?》提供了一批有明确适用边界的发现计划允许将这些发现作为参考事实但不得越界推广。论文支持的事实保留其范围限制论文作者评估的是一套基于 book-to-skill 的受控配方并非本仓库当前完整生成器按文档结构切块无结构时回退约 4,000 词为每块生成简短 summary 加KEY_ELEMENTS并路由到原始 chunk 文本整体来看单层 / 扁平flat技能包是该研究中的最佳默认把章节描述塞进常驻加载的子技能会造成上下文压力甚至有害渐进式披露的价值取决于 harness单本书场景下像论文测试的 Codex 那样的强导航 Agent 能自己重建grep - locate - read流程从而削弱预制技能包的准确性优势多书规模下尤其是论文测试的英文开放问答扁平披露比原始导航退化得更慢论文中的KEY_ELEMENTS字段被使用了但其独立贡献没有被消融验证论文没有验证当前 book-to-skill 的语义表示框架、心智模型、反模式、决策规则、术语表 / 模式 / 速查表以及当前章节模板——这些不是论文实验的自变量论文明确没有建立向代码、技术手册或其他非叙事语料的迁移结论成本结果如 K20 英文问答中 68.3M vs 32.5M token 的对比是特定条件下的未缓存测量不是普遍的省 2 倍声明。附录的重要细节不要将层级永远无益当作产品不变量。论文附录存在任务 / 规模相关的单元其中更深层路由可以恢复甚至领先例如某些 Pi 开放问答条件。安全的工程设计结论是扁平是默认要打败的对象。更深的路由是一个实验既不是被禁止的架构也不是生产要求。留给本仓库的开放问题在计划产出证据前均为假设当前结构化表示相比论文式summary key elements raw chunk表示是否能改善应用 / 决策类任务增加精确路由词 / 实体是否值得其带来的常驻 / 激活上下文成本显式 / 强制激活能否把路由失败与表示 / 推理失败分离论文的扩展规律能否在技术书、文档、SOP 类材料上复现对真实的 book-to-skill 收藏集库级索引是否有用结构化章节 源证据访问是否优于仅结构或仅原文在路由与表示受控之后不同的 chunk 粒度是否仍有影响3. 研究规则保持因果问题可分离评估计划的第一条纪律不要在同一个对比中改变多个设计轴。实验统一使用以下因果分解链SOURCE - CHUNKING - ROUTING METADATA - DISCLOSURE DEPTH - ON-DEMAND REPRESENTATION - HARNESS ACTIVATION/NAVIGATION - ANSWER/DECISION一次有效实验只高亮其中一个轴其余轴在 harness 允许的范围内保持不变测试表示representation保持 chunk 边界与路由索引完全一致只改变路由后打开的有效载荷测试路由元数据routing metadata保持 chunk 有效载荷一致只改变索引元数据测试激活activation保持技能包一致在 harness 支持时对比自动发现与显式激活测试切块chunking固定路由 / 表示配方只改变边界。如果某个 harness 无法恒定某一变量则记录混杂因素confound而不是声称因果隔离。4. 成本纪律没有可改变决策的昂贵运行计划对真实模型live-model运行设置了严格的准入条件。每次运行前必须生成配置 / manifest包含来源 / 语料 ID 与哈希条件名condition问题集 ID 与哈希模型与 harness生成模型若与作答模型不同prompt / 配置哈希支持时的重复 / 种子信息max_callsmax_input_tokensmax_output_tokens可选max_cost_usd仅当操作者提供当前价格时本次运行的必要理由以及它能改变什么决策。runner 必须停止而不是静默超出配置的硬上限。任何新实验的运行顺序单元测试 / fixture 重放一两个冒烟问题smoke questions最小的可判别语料仅在方差 / 不稳定需要时才重复只有小规模运行给出继续的理由后才进行更大 K 或更广的扫描。永远不要从 20 本书的扫描开始。当来源 / 配置 / 模型 / prompt 身份一致时应复用已生成的技能包不要为相同输入重复付费。5. 计划的仓库形态以下是计划中的目录结构注意这是计划形态当前仓库已实现其中部分任务可依据仓库实际变化调整路径但变更前必须更新计划tools/evals/ manifest.py # stable run manifest hashes budget fields score.py # deterministic metrics where possible replay.py # replay recorded/synthetic trajectories without APIs paper_flat.py # paper-style baseline pack builder run.py # experiment orchestration / dry-run / budget gate adapters/ # live harness adapters, added only when justified tests/evals/ ... # deterministic unit/integration tests evals/ fixtures/ # synthetic/public-domain/licensed tiny fixtures only configs/ # committed experiment configs, no secrets results/ # small aggregate summaries/manifests only .eval-work/ # local raw trajectories, generated packs, private corpora; gitignored目前仓库中 tools/evals/ 已落地manifest.py、score.py、replay.py、paper_flat.py四个工具对应 PD-01 至 PD-03 任务run.py与adapters/属于被阻塞BLOCKED的 PD-04。关键约束评估代码不得成为 book-to-skill 的运行时依赖除非后续生产决策明确将其中某部分升级进产品。6. 核心指标不要用最终答案准确率概括一次实验计划要求记录 harness 暴露的所有观测分为四类路由 / 导航Routing/Navigation技能被发现 / 激活情况可观测时目标书籍是否被选中目标章节 / chunk 是否被选中打开过的文件目标前打开的无关文件数工具调用grep、读 / 打开、搜索等可观测时到达首个相关证据前的时间 / 调用数。结果Outcome存在标准答案时的精确 / 确定性答案得分应用 / 决策任务的任务特定评分表rubric结果在给出错误答案前是否已到达正确的源证据。效率Efficiency输入 token、输出 token、总调用数可比较时的耗时仅当价格显式记录日期与来源时才记录当前估计货币成本宿主暴露时分别记录缓存与未缓存用量。表示诊断Representation Diagnostics当正确 chunk 已打开但答案错误时仅在可观测证据支持的前提下分类证据存在但推理 / 作答失败结构化表示遗漏了必需证据路由选择了错误材料未知 / 歧义。计划明确禁止从答案字符串推断隐藏推理。7. 任务台账总览任务状态语义READY依赖齐备下一个 Agent 可接手、BLOCKED等待所列依赖、IN_PROGRESS一个 Agent 独占需在证据账本中给出分支 / PR、DONE所有验收门已验证、REJECTED假设 / 方法失败保留证据与理由。ID状态任务依赖生产变更PD-00DONE冻结当前基线与评估契约无否PD-01DONE实现确定性 manifest 哈希 预算 schemaPD-00否PD-02DONE实现 fixture / 重放评分器与轨迹指标PD-01否PD-03DONE实现 paper-flat 基线技能包构建器PD-01否PD-04BLOCKED增加 dry-run / 实况 runner 契约与首个 harness 适配器PD-02, PD-03否PD-05BLOCKED表示实验原始载荷 vs 结构化 B2S 载荷PD-04否PD-06BLOCKED自动 vs 显式激活实验PD-04否PD-07BLOCKED路由元数据消融PD-04否PD-08BLOCKED技术 / 非叙事语料复现PD-05, PD-07否PD-09BLOCKED库级扩展实验PD-04, PD-08否PD-10BLOCKED可选 Hybrid RAG 参考基线PD-04否PD-11BLOCKED切块消融PD-08否PD-12BLOCKED证据评审与生产决策相关实验仅决策8. 任务规格详解PD-00 — 冻结当前基线与评估契约DONE目标在编写新评估设施之前生成一个零 API 的基线快照。必需动作运行当前仓库检查在 license 安全 fixture 或现有允许的本地来源上运行 / 检查 tools/discovery_tax.py不得提交受版权保护的源文本记录当前工具测量了什么 vs 建模了什么不改动地从 docs/architecture.md 与 SKILL.md 记录当前生成器架构为确定性评估开发选择极小的合成 / 公有领域 fixture 集。验收pytest -q ruff check . python3 tools/validate_skill.py SKILL.md外加一份已提交的小型基线说明 / manifest不含原始受版权材料并清晰标注建模 vs 测量的数字。本任务不得修改生产生成行为。PD-01 — 确定性运行 manifest、哈希与预算DONE目标让每一次后续结果都可归因、可复用。最小字段schema 版本 / 运行 ID来源 ID 内容哈希条件问题集哈希模型 / harness 标识prompt / 配置哈希种子 / 重复字段不支持处显式写unsupportedtoken / 调用 / 成本上限代码版本 / commit SHA可用时产物 / 结果路径。源码级实现tools/evals/manifest.py 已将其全部落地SCHEMA_VERSION pd-run-manifest/v1manifest.py_REQUIRED强制校验必填字段manifest.pycanonical_json使用ensure_asciiFalsesort_keysTrue 紧凑分隔符保证 UTF-8 保留与稳定序列化manifest.pysha256_file分块读取文件原始字节计算 SHA-256manifest.py密钥护栏_SECRET_MARKERS检查键名_SECRET_VALUE_PATTERNS用正则识别 Bearer token、sk-、ghp_、AWS AKIA、JWT、glpat-等常见密钥形态命中即拒绝manifest.py——注意这只是护栏而非 DLP 保证提交物中只应存标识符或哈希预算字段要求max_calls、max_input_tokens、max_output_tokens为非负整数硬上限max_cost_usd为有限非负数_budgetsmanifest.pyrun_id由排除artifacts/results后其余字段的规范 JSON 的 SHA-256 生成manifest.py_commit尝试读取 git HEAD不可用时为unavailable并从身份中剔除。需求仅用标准库实现稳定序列化确定性哈希测试已提交 manifest 无密钥缺失 / 无效必填字段明确失败。验收目标测试证明相同输入生成相同身份、有意义的配置变更改变身份。全部pytest -q与ruff check .通过。tests/evals/test_manifest.py 覆盖了相同输入产生相同 manifest 与run_id含 UTF-8 内容如café、条件 / 来源 / commit 任一变化都改变run_id、13 种非法配置缺字段、负预算、各类密钥形态均明确失败、CLI 重复运行字节级稳定。PD-02 — Fixture / 重放评分器DONE目标不花模型 token 就证明评分与轨迹记账正确。使用代表以下情形的极小合成轨迹正确路由 正确答案错误书籍 / 章节路由到达正确证据 错误答案目标前多次无关打开缺失 / 未知可观测性。输出机器可读的聚合与逐题结果。评分器不得猜测未观测到的状态。源码级实现tools/evals/score.py 定义UNKNOWN unknownscore.py_state只保留显式布尔观测其余一律UNKNOWNscore.py。score_trajectory的分类逻辑score.py三要素任一UNKNOWN→ 分类为unknown路由错误 →wrong_routing路由对但答案错 →wrong_answer目标前有无关打开 →irrelevant_opens_before_target否则 →correct。aggregate只累加已记录的 token / 调用缺失的用量保持UNKNOWN绝不估计score.py。配套的 tools/evals/replay.py 定义pd-replay-fixture/v1与pd-replay-result/v1schema加载 fixture 后调用评分并输出规范 JSON。真实 fixtureevals/fixtures/replay_trajectories.json 恰好包含 5 条合成轨迹01-correct、02-wrong-routing、03-wrong-answer、04-irrelevant-opens、05-unknown与计划的分类矩阵一一对应。验收tests/evals/test_score.py 与 tests/evals/test_replay.py 覆盖上述全部分类及 token / 调用聚合replay命令重复运行产出稳定 JSON字节级一致。PD-03 — Paper-flat 基线包构建器DONE目标构建一个可复现的基线足够贴近论文的实验性表示用于受控对比同时不假装它是仓库当前生成器。基线结构一个根SKILL.md用于发现的书籍级描述激活时加载的 chunk 路径 简短描述的表格 / 索引索引中每个 chunk 的SUMMARY与可选KEY_ELEMENTS元数据按需加载的原始 chunk 载荷文件按源结构切章并带显式回退策略无标题时整源作为单个 chunk。源码级实现tools/evals/paper_flat.py 的_CHAPTER正则匹配# 标题与Chapter/Chap. N阿拉伯或罗马数字paper_flat.py_chunks按标题切分、无标题则返回整源回退paper_flat.pybuild_paper_flat生成一个根SKILL.md含## Activation-time chunk table列为Path | Description | SUMMARY | KEY_ELEMENTS加若干chunks/chunk-NN.md原始载荷文件paper_flat.py。对应 fixture 见 evals/fixtures/pd03-book.txt 与 evals/fixtures/pd03-metadata.json后者提供title/description/ 每 chunk 的description、summary与可选key_elements。关键规则不要把这种表示加入生产SKILL.md。它是实验基线。生成 summary / KEY_ELEMENTS 在实况模式可能需要模型测试必须使用固定 fixture 输出保证 CI 离线且确定。验收给定相同 fixture 与固定元数据构建器输出稳定且恰好只有一个路由层级测试验证不引入子技能层级。tests/evals/test_paper_flat.py 还验证了缩进代码行不会误触发切块、无标题时整源回退为单 chunk、相同输入产出字节级相同包、包内文件恰好为SKILL.md 两个 chunk 文件。PD-04 — Runner 契约 首个实况 harness 适配器BLOCKED目标在相同问题 / 配置外壳下运行raw、paper-flat以及一个提供的 / 冻结的当前 B2S 技能包记录可观测轨迹与成本数据。选择适配器之前先检查可用的上游工具链优先兼容已有 Agent 协议 / 环境例如 ACP / LOONGDOC若可访问且可复用而非自造专用 harness。Runner 必须支持--dry-run仅打印计划条件 / 调用 / 预算不产生任何模型调用宿主用量数据允许时硬性调用 / token 预算门git 之外的本地工作目录一次只跑一个条件即使受控失败也要产出结果 / manifest适配器能力声明文件打开可观测激活可观测token 可观测是否支持强制激活。验收先保证 fixture / 重放适配器全绿然后在声明预算内执行一次极小实况冒烟运行。不做大规模扫描。PD-05 — 表示实验最高优先级研究问题BLOCKED问题当路由保持不变时当前结构化 book-to-skill 载荷是否比原始章节文本或简单表示更能帮助 Agent应用知识条件保持相同来源、chunk 边界、根路由元数据、harness、模型、问题与激活条件只改变按需载荷RAW_CHUNK— 原始 chunk 文本SIMPLE— 简单摘要表示B2S_STRUCTURED— 当前结构化章节表示B2S_STRUCTURED_WITH_SOURCE_FALLBACK— 结构化表示 源证据访问若 harness 能不改路由地隔离该对比。若条件 4 无法干净隔离推迟它而不要污染主对比。任务族使用能区分表示类型的问题——事实检索、解释 / 理解、场景应用、基于源标准的决策 / 权衡、反模式 / 反例。升级规则单一数据集 / 单元格不得产生生产声明记录任务族特定效应与方差零结果同样是有效结果。PD-06 — 自动 vs 显式激活BLOCKED问题多少失败来自发现 / 路由到技能多少来自正确技能可用后的知识使用同一技能包与问题在两种条件下运行AUTO— 宿主正常发现 / 激活FORCED— 正确技能被显式激活 / 提供仅当 harness 支持干净的强制条件时。若不支持强制激活将适配器能力标记为 false不要在不记录差异的情况下模拟所谓等价机制。输出在可观测性允许的范围内分离路由 / 激活成功与下游作答表现。PD-07 — 路由元数据消融BLOCKED问题哪部分元数据挣回了它的上下文成本保持 chunk 载荷与边界不变按顺序对比SUMMARY_ONLYSUMMARY_EXACT_TERMSSUMMARY_KEY_ELEMENTS论文式CURRENT_B2S_INDEX或其精确定义的投影。同时记录路由成功与元数据 token 开销。重要KEY_ELEMENTS不是已验证的生产需求。该实验存在正是因为论文没有隔离其效果。生产门候选只有改进在多个合适语料 / 任务族上重复出现、且已报告新增上下文成本时才考虑增改路由元数据否则维持现状。PD-08 — 技术 / 非叙事语料复现BLOCKED问题论文的有用效应能否迁移到 book-to-skill 通常设计处理的材料——技术书、文档、标准、SOP 类内容语料要求公有领域、宽松许可、合成或明确授权在得出产品结论前至少两种不同的结构 / 内容类型避免只用著名材料作为唯一基准因为参数记忆可能掩盖检索 / 导航失败。路由测试优先使用留出 / 合成事实。验收直接运行已定义条件复现期间不增加新功能发布法律上可安全提交的聚合 manifest / 结果。PD-09 — 库级扩展BLOCKED问题对真实非叙事 book-to-skill 材料收藏集级索引何时变得有用不要先在生产实现library-to-skill。实验条件可包括无库索引类似论文corpus-index.md的每源一行索引条件 2 测量后的更丰富语义库索引。规模纪律从 K1 与 K5 开始仅当小规模运行留下未解决的扩展问题或显示有意义的发散时才进入 K10K20 必须有书面理由与预算。生产门候选仅当索引在真实目标域语料上提供可复现收益、且不只是把过多上下文塞进常驻层时库功能才成立。PD-10 — 可选 Hybrid RAG 参考基线BLOCKED目标提供外部检索参考不是运行时功能。论文参考栈为 BM25 BGE-M3 稠密检索 倒数排名融合reciprocal-rank fusion BGE 交叉编码器重排。仅当 Agent 条件已足够稳定、该对比能回答某个决策时才复现或复用该栈。规则重型 ML 依赖保持仅评估优先使用独立可选环境 / requirements 文件不得从该基线声称Skills 打败 RAG报告精确的检索器 / 嵌入 / 重排器版本与预算。若此任务维护成本超过决策价值可显式REJECTED并附理由。PD-11 — 切块消融BLOCKED仅在表示 / 路由测试稳定后运行。对比小集合源章节 / 小节边界保段落的固定大小 chunk提取器可靠暴露时的结构感知技术小节。保持路由元数据配方与载荷表示恒定。不得同时改变提取、路由与表示。PD-12 — 证据评审与生产决策BLOCKED仅决策这不是编码任务而是决定任何实验想法是否进入产品的闸门。对每个候选从四种结论中选一ADOPT— 证据支持一个聚焦的生产 PRKEEP EXPERIMENTAL— 某些场景有用但不是安全默认REJECT— 无已证实的价值或成本 / 复杂度不可接受INSUFFICIENT EVIDENCE— 需要更多数据并指明缺失的确切对比。候选生产决策与ADOPT前的最低证据候选生产想法ADOPT前的最低证据增加精确词 / KEY_ELEMENTS 式路由元数据PD-07 重复收益 已测量上下文开销修改章节表示 / 模板PD-05 任务族收益且无不可接受的检索回退增加显式库模式 / 索引PD-09 目标域扩展收益增加更深 / 自适应层级特定重复任务 / 规模收益且计入上下文成本后仍胜过扁平向普通产品输出增加生成 / 评估 manifest超出评估工具的用户 / 可复现性价值作出 RAG 优势声明绝不普遍化只能给出精确设置的、条件特定的基准陈述任何采纳的功能以独立聚焦 PR 落地带新测试与前后证据。PD-12 本身不得同时改动多个生产面。9. 证据账本Agent 在任务状态变化时更新此表条目保持简短链接到 PR / commit / 结果路径而非粘贴长日志。任务状态PR / commit证据备注PD-00DONE——基线已记录PD-01DONE—tests/evals/test_manifest.py确定性 manifest、来源 SHA-256、预算 / 密钥校验PD-02DONE—tests/evals/test_score.py、tests/evals/test_replay.py离线轨迹评分器与重放 runnerPD-03DONE—tests/evals/test_paper_flat.py合成 paper-flat 基线构建器PD-04BLOCKED——等待 PD-02 / PD-03PD-05BLOCKED——主要表示实验PD-06BLOCKED——依赖宿主能力PD-07BLOCKED——此前不做生产元数据变更PD-08BLOCKED——目标域复现PD-09BLOCKED——此前不落地库功能PD-10BLOCKED——可选参考基线PD-11BLOCKED——晚期消融PD-12BLOCKED——生产决策闸门10. 声明护栏证据改变前不得发布的事实在证据改变之前以下表述不得被当作既定事实发布或写入产品论文验证了当前完整的 book-to-skill 生成器。KEY_ELEMENTS 能改进路由。它被使用了但未被独立消融。book-to-skill 少用 2 倍 token。被引用的约 2 倍结果只是某个 K20 英文问答条件的特定数字。Skills 打败 RAG。论文在特定任务下对比了特定混合基线。扁平总是胜过层级。扁平整体是最佳默认附录效应是任务 / 规模特定的。结果适用于技术书 / 代码。论文明确把非叙事迁移留作开放问题。结构化框架 / 心智模型 / 反模式优于摘要。那是 PD-05 的问题。安全语言必须点名条件或说明问题仍然开放。11. Agent 指令兼容性仓库以根目录 AGENTS.md 作为规范的 Agent 执行契约。依据当前工具链文档理由如下开放的 AGENTS.md 格式面向被编码 Agent 消费的仓库指令OpenAI Codex 将根 AGENTS.md 限定于仓库树并允许更深层文件覆盖更窄子树Claude Code 目前读取的是CLAUDE.md而非直接读取AGENTS.md因此仓库包含一个极简的 CLAUDE.md 导入AGENTS.md而非复制规则。保持根指令文件紧凑。详细的计划状态放在本文档评估计划中而不是复制进每个 Agent 的常驻上下文。12. 完成的定义研究计划在同时满足以下全部条件时才算完成确定性评估基础设施存在且已测试至少一个真实 harness 在受控条件下产出可检视的轨迹 / 成本结果在合法 / 合适的语料上运行了 paper-flat 与当前 B2S 的对比在 harness 支持的范围内路由与表示已尽可能分离已尝试技术 / 非叙事语料复现库级扩展要么被测量要么被显式拒绝为不值得每个生产候选都获得ADOPT / KEEP EXPERIMENTAL / REJECT / INSUFFICIENT EVIDENCE决策任何被采纳的行为以独立聚焦 PR 落地带测试与证据公开声明只更新到测量实际支持的内容。成功的标准不是所有提议功能都上线而是我们能够识别哪些想法挣回了它的复杂度、哪些不应进入 book-to-skill。当前仓库已完成的 PD-00 至 PD-03 恰好为此打下了确定性、离线、零 API 的测量底座而 PD-04 之后的实况实验将决定论文的渐进式披露思想在技术书籍场景下究竟值不值得成为生产默认。【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考