ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

CodeBurn 发布验收 Agent 执行手册:从候选 SHA 到 release-ready 的可复现审计契约

2026/9/24 4:48:53 拓冰建站 浏览量
CodeBurn 发布验收 Agent 执行手册:从候选 SHA 到 release-ready 的可复现审计契约 【免费下载链接】codeburnFree, local tool to track AI coding token usage and cost across 37 tools and agents (Claude Code, Cursor, Codex, Gemini and more), by model, project, and task. npx codeburn项目地址https://gitcode.com/gh_mirrors/co/codeburn点击查看免费下载CodeBurn 是一个免费、本地的 AI 编码 Token 用量与成本追踪工具覆盖 CLI、TUI、桌面端、菜单栏和本地 Web 五种界面。本文将讲解其发布验收体系docs/release-acceptance/的核心文件 AGENT-RUNBOOK.md当把一个候选版本交给审计 Agent 时必须遵守的验收契约、不可妥协的控制项、12 步执行序列以及ready/conditional/not-ready三种判定标准。读完本文你将掌握一套可复制的发布前审计工作流如何锁定候选产物、如何用真实点击流验证每个界面、如何独立核算黄金语料、如何记录证据并追加账本。验收的总体目标证明即将发布的确切候选验收不是跑一遍单元测试就结束。该体系在 README.md 中明确写道它是一套证据系统而不是声称单元测试等同于使用产品evidence system, not a claim that unit tests are equivalent to using the product。审计 Agent 的目标是对即将发布的确切候选the exact candidate that will ship给出认证certify或拒绝reject的结论需要证明以下七个维度安装installation打包产物能被正确安装、签名与信任见效速度time-to-value首次有用输出是否在合理时间内出现正确性correctness调用数、Token、成本、边界日期的核算与独立计算完全一致响应性responsiveness首屏反馈、热导航等是否达标恢复能力recovery离线、损坏缓存、并发、中断后能否自愈或给出可操作错误隐私privacy遥测与远程同步默认关闭敏感信息不外泄机器卫生machine hygiene验收结束后机器上只保留一份健康的当前安装残留被记录在案。这七个维度必须横跨 CLI、TUI、Desktop、Menu Bar 和本地 Web 全部五种界面逐一验证。不可妥协的控制项Non-negotiable controls运行手册开篇就列出 11 条红线任何一条都不能妥协。它们共同保证了测的是正确的产物、用的是正确的方法、记录的是正确的证据锁定权威远端拉取权威 remote 并固定 SHA、ancestry父提交、版本、产物校验和、工具链、macOS 版本和硬件再开始测试。从干净工作区开始绝不静默恢复构建产生的改动一旦发现构建污染了 tracked 文件记录并判定可复现性门槛失败fail the reproducibility gate。这一点在自动化运行器中有直接实现见下文。只使用打包/可安装产物测试对象必须是官方入口点产出的包而不是本地临时构建。真实使用界面Desktop 和 Menu Bar 必须使用真实的 Computer Use点击流Web 必须使用真实浏览器交互。仅凭截图或 CLI 输出不能证明一个点击流程跑通。Persona A 使用隔离环境在隔离的 HOME/config/cache 中严格按当前第一用户文档字面操作。Persona B 使用冻结语料在真实语料的冻结副本上测试真实历史与凭据保持只读。registry 必须全跑cases.csv中的用例可以增加但不能遗漏additions are welcome, omissions are not。记录单调时钟原始计时保留 JSON/CSV/logs/截图等原始证据。独立核算黄金语料各界面数字一致是必要条件但不是充分条件——如果大家用同一个错误算法会得到同一个错误数字。同意含糊一律保守对所有requiresApproval或其他同意语义含糊之处采取保守处理不推断权限。禁止越权外发除非另行授权不得发送遥测/同步、发布、合并、开 issue 或改动外部系统。第 10 条与代码仓库中的同步同意机制相呼应src/sync/consent.ts实现了同意一次consent-once的自动同步模型任何将要外发内容的变更目的地、节奏、范围、work matching、字段集合都会改变 SHA-256 指纹computeAcceptanceFingerprint触发acceptance-required状态并要求用户重新接受detectFingerprintChanges返回变更清单披露文本明确列出哪些数据外发、哪些数据留本机原始提示词永不发送、文件路径只发送项目 basename并可通过codeburn sync auto disable停止。这正是不推断权限这一红线在代码层的具体落点。必需执行序列Required sequence12 步验收流水线运行手册给出一个严格的 12 步顺序不允许跳步或重新排序候选解析与变更前盘点candidate resolution and pre-mutation inventory锁定 SHA记录基线状态。可逆备份/隔离与干净安装reversible backup/quarantine and clean install。自动化运行器 package 模式执行 scripts/release-acceptance/run.mjs。两轮卸载/重装循环检查身份identity、Gatekeeper、进程路径和重启后状态。Persona A 上手零状态引导、空状态、帮助/报错、每个可见目的地/控件、键盘、缩放、主题、无障碍。黄金夹具Golden fixture每条相关执行路径跑 3 次冷启动 5 次热运行。Persona B 重语料记录首次有用输出/完整耗时、导航、峰值资源至少在 5 个可用 Provider 上采集 30 条原始会话。跨界面同过滤器对账所有界面用相同过滤器结果必须一致。恢复用例离线、锁定/不可读 Provider、损坏/中断缓存、并发运行、SIGINT/重启、睡眠/唤醒、登录重启。最终单安装盘点每类界面只保留一份当前安装恢复兼容状态保留惰性备份产出残留清单residue manifest。结论撰写每个 finding 必须包含严重级别、精确前置条件/复现步骤、期望/实际/频率、脱敏证据、隐私影响、负责人、规模以及 autonomous/HITL 分类。独立评审后追加账本只有经过独立评审才允许向账本追加一行记录。第 3 步的自动化运行器是关键基础设施。run.mjs支持三种模式preflight、tests、packagenode scripts/release-acceptance/run.mjs --mode package --output /absolute/evidence/run-id从源码run.mjs可以看到其行为契约--output必须是绝对路径isAbsolute校验否则拒绝执行运行前先检查git status --porcelainv1工作区不干净直接抛错终止第 93-94 行这是从不静默恢复构建改动红线的机器执行自动采集 provenance第 96-119 行git SHA、parent、branch、version、commit 信息以及 macOS 的sw_vers、架构、硬件型号、内存、Node/npm/Swift 版本写入provenance.json权限 0600tests模式追加执行根测试、lock 测试和 Swift 原生测试package模式再追加生产构建和 Menu Bar 打包mac/Scripts/package-app.sh每个子命令的 stdout/stderr 全部落盘到logs/id.log打包成功后对产物CodeBurnMenubar-sha8.zip计算 SHA-256 并记入automated-results.json结束再次检查工作区是否被污染clean_after污染则整体判 fail所有结果写入automated-results.json和timings.csv。用例注册表cases.csv 的结构与分阶段执行验收的测试内容全部登记在 cases.csv 中共 12 个阶段 70 个用例RA- 前缀 阶段缩写 序号。每行包含id, phase, persona, surface, test, method, automation, evidence, threshold, blocking, owner。几个代表性用例用例阶段表面测试内容methodblockingRA-PROV-001provenanceall权威远端 SHA 与 ancestry 锁定scriptyesRA-BUILD-003buildMenu BarSwift 测试、universal 包与部署目标scriptyesRA-INSTALL-002installDesktop两轮卸载/重装循环computer-useyesRA-A-002onboardingDesktop遥测退出选项清晰且被遵守computer-useyesRA-UI-007clickthroughMenu Bar状态项可见、左键弹出 popovercomputer-useyesRA-PERF-001performanceCLI黄金打包冷启动 3 次shellyesRA-PERF-004performanceWeb首次有用绘制与热操作browsernoRA-ACC-001accuracyall黄金调用/会话/Token 族independent-calculationyesRA-REC-003recoveryCLI独占锁定的 SQLite 副本shellyesRA-REV-001reviewall独立复现与代码评审reviewyes要点method 决定证据形式script/shell可由自动化完成computer-use/browser必须是真实点击independent-calculation要求独立核算mixed/review/external-test各有用途owner 决定责任归属release、build、engineering、desktop、menubar、web、product、privacy、cli、accessibility、performance、correctness、reliability、quality一目了然blocking 标志绝大多数是yes发布阻断少数观测类用例是no例如RA-PERF-004的 Web 首次绘制flag 而非硬门槛。证据阶梯与验证标准README 定义了五级证据阶梯从弱到强源码检查或单元测试只能证明代码意图冻结夹具frozen fixture证明受控输入下输出确定打包并安装的产物证明被评估的是可分发物真实交互证明用户可见路径被点击并检查过受影响机器证明针对无法在本机复现的 OS/账号/Provider 特定故障。关键原则代码检查可以解释结果但不能替代已安装 UI 的行为Code inspection can explain a result; it cannot substitute for installed UI behavior。一个 finding 只有在记录了可获得的最强证据、且排除了可能的测量伪影measurement artifacts后才算确认。发布节奏Cadence也写明了证据梯级的适用场景每个主干变更现有 CI 聚焦回归测试次版本发布前自动化运行器、冻结黄金语料一致性、安装/打包身份、每个已发布界面的 smoke 点击流、所有历史失败用例主版本或实质性的 parser/cache/UI 变更前跑完整cases.csv注册表、两轮干净安装、3 次冻结冷试、5 次热试、真实语料抽样、对抗性恢复、无障碍、残留清单、独立评审。计时与正确性指标、观测标志与黄金对账计时必须使用单调时钟monotonic clock。需要记录的指标包括首次可见反馈、首次有用输出、完整结果、热导航、CPU/RSS可行处以及 totals 是否一致。受控性能分布使用同一冻结语料上的 3 次冷试 5 次热试。继承的观测标志observational flags有五个它们是分诊信号而非合同阈值250 ms 内无可见 UI 反馈热导航超过 1 秒出现无阶段/进度文案的停顿违反文档化的产品 SLA相对前一次可比账本运行出现回归。正确性核算要求独立计算以下每一项调用数、input/output/cache/reasoning 各类 Token、priced/unpriced/estimated 语义、亚美分精度sub-cent的成本、时间边界、去重/恢复处理、委派子代理delegated-agent归因。任何不一致都必须调查不能平均掉do not average it away。计时数据通过 templates/timings.csv 记录列包括run_id, case_id, surface, persona, operation, trial, cache_state, start_monotonic_ms, first_feedback_ms, first_useful_ms, complete_ms, cpu_peak_pct, rss_peak_bytes, calls, tokens, cost_usd, identical_totals, notes。此外会话解析、增量重解析、周期切换和 CLI 冷启动的 wait-path 性能数字由 scripts/perf/ 与 perf/README.md 中的独立性能基准负责它产出timings.csv模板但不能替代本验收运行器也不声称覆盖已安装的 Desktop/Menu Bar UI。准确度证据则落在 templates/accuracy.csv每一行按 Provider/session 对比 expected 与 actual 的calls、各类 token、cost_usd并标注priced_state、estimated_state和status。隐私与安全验收中的红线遥测与远程同步保持关闭除非某个命名测试明确授权本地接收端或 dry run绝不打印密钥、不枚举环境变量保留 Keychain 条目Provider 历史与真实缓存只读破坏性恢复使用副本分享前必须审查截图与日志中的项目名、路径、消费、账号数据与凭据发布签名/公证、意外权限、凭据、CAPTCHA、不可逆删除属于人工闸门human gates。这一点与 12 步序列中Persona A 遥测退出、Persona A 隔离 HOME相互配合审计 Agent 本身也是被测对象的消费者必须把自己隔离在干净的沙箱环境里同时确保不触碰真实账号的敏感凭据。判定标准ready / conditional / not-ready运行手册的判定规则非常明确ready在确切产物上所有发布阻断用例通过无 P0/P1 遗留所有已发布界面都有运行时证明。conditional没有已知的正确性或隐私损失但仍有一个具名的人工闸门受影响机器、或发布身份release-identity闸门待通过。not-ready出现以下任一情况——任何 P0/P1、账本错误或静默为空incorrect or silently empty accounting、普通冷启动路径不可用、安装/信任破坏、某个已发布界面被跳过、或残留未被控制uncontained residue。两条提醒写得非常直白不要因为修复看起来很容易就软化判定Do not soften a verdict because a fix seems easy不要在没有证明普通用户能触达的情况下夸大边缘案例Do not inflate an edge case without proving an ordinary user can reach it。运行记录与账本证据如何沉淀每次运行的记录结构由 ledger.schema.json 约束JSON Schema draft 2020-12必填字段run_id至少 8 字符、started_at、candidate、environment、verdict、surfaces、evidence、limitationscandidate要求 40 位十六进制sha与parent、version以及带sha256的artifacts数组environment要求os, arch, hardware, node, npm可选swift、memory_bytesverdict枚举ready/conditional/not-ready/incompletesurfaces每个表面的状态枚举pass/fail/conditional/blocked/not-shippedfindings需要id、severityP0-P3、statusopen/fixed/not-reproduced/downgraded、summaryevidence需要root、timings、click_through、accuracy、residue五类证据的路径。账本本体是 ledger/history.jsonl只追加、不重写append-only。README 规定发布后追加该产物结果不得改写旧运行记录。账本里的真实先例2026-08-25 的一次审计展示了这套体系如何工作候选b305378e、版本 0.9.21、macOS 26.6.1 / Apple M3 Ultra / Node v22.22.3黄金语料为 9 次调用、8 个会话、1220 input / 242 output / 490 cache-read / 70 cache-write Token、成本 0.010186 USD判定为not-ready因为 Desktop fail、Menu Bar blocked并列出 5 个 P1/P2 findingGatekeeper 拒签、同 SHA 不同表面嵌入不同定价、锁定 SQLite 静默报空、重语料冷启动首次有用输出延迟、退出后残留进程limitations 里如实记录了 Menu Bar popover 无法寻址、真实 Provider 语料未纳入交接。这个例子恰好印证了 runbook 中静默为空即 not-ready和blocked 不等于 pass的规则。所有权与人工闸门Agent 能做什么、不能做什么自动化边界在 README 的 Ownership 一节写得很清楚。Agent 可以自主执行确定性测试、本地打包、计算夹具真值、性能剖析、采集截图、在副本上做恢复测试、起草 findings。人类拥有产品语义、SLA 选择、Apple 凭据/签名、意外安全提示、真实账号同意、受影响机器验证。任何 Agent 都不能仅因自动化账本变绿就合并代码、发布版本或传输数据No agent should merge, publish a release, or transmit data merely because the automated ledger is green。结语把发布变成可审计、可复现、可问责的流程CodeBurn 的发布验收体系把一次性的狗粮审计dogfood audit变成了可重复的发布闸门。核心价值不在自动化程度有多高而在于它构建了完整的证据链从锁定候选 SHA 与校验和到自动化运行器强制干净工作区、真实点击流覆盖每个界面、独立核算黄金语料、冻结副本上的恢复测试再到只追加的账本和独立评审。对于任何一个以 CLI 桌面应用形态发布、且涉及真实消费数据与隐私的本地工具而言这套 AGENT-RUNBOOK 契约都是一份可以直接复制执行的范本——它回答了发布前最后一个问题我们凭什么相信这个确切候选可以交给用户。赞分享【免费下载链接】codeburnFree, local tool to track AI coding token usage and cost across 37 tools and agents (Claude Code, Cursor, Codex, Gemini and more), by model, project, and task. npx codeburn项目地址https://gitcode.com/gh_mirrors/co/codeburn点击查看免费下载相关推荐CodeBurn 发布验收体系实战指南把一次性的 dogfood 审计变成可重复的发布门禁CodeBurn 发布验收体系实战指南把一次性的 dogfood 审计变成可重复的发布门禁 本篇技术指南系统讲解 CodeBurn 仓库中 docs/relescientific-agent-skills 数据库查询的检索契约与审计清单让 Agent 每次 API 查询都可复现、可审计scientific agent skills 数据库查询的检索契约与审计清单让 Agent 每次 API 查询都可复现、可审计 在 scientific aAI 技能科研生物信息学数据科学gbrain eval takes-quality跨模型评审面板与 4-Sha 回执契约构建 Takes 层可复现质量门禁gbrain eval takes quality跨模型评审面板与 4 Sha 回执契约构建 Takes 层可复现质量门禁 gbrain eval take人工智能RAGAgent 记忆MCP 服务知识管理创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考