ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Ablation Plan

2026/9/22 9:30:20 拓冰建站 浏览量
Ablation Plan AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep点击查看免费下载Component Ablations (highest priority)#NameWhat It TestsExpected If MattersPriority1remove module Xcontribution of Xperformance drops on metric Y12replace X with simpler Zvalue of learned vs fixeddrops, especially on dataset A2Hyperparameter Sensitivity#ParameterValues to TestWhat It TestsPriority3lambda[0.01, 0.1, 1.0]sensitivity to regularization3Design Choice Comparisons#NameWhat It TestsPriority4joint vs separate matchingwhether joint adds value4Coverage Assessment[What reviewer questions these ablations answer]Unnecessary Ablations[Experiments that seem useful but wont add insight — skip these]Run Order[Optimized for maximum early information]Estimated Compute[Total GPU-hours]这份模板本身就是一份可直接落地的实验清单七个区块各有用途 - **Component Ablations组件消融**优先级最高通过删除模块 X或用更简单的 Z 替换 X来隔离每个新组件的贡献 - **Hyperparameter Sensitivity超参敏感性**如 lambda 取 [0.01, 0.1, 1.0] 检验对正则化强度的敏感性 - **Design Choice Comparisons设计选择对比**如联合匹配 vs 分离匹配回答的是设计层面的自然替代方案 - **Coverage Assessment**对照审稿人问题清单说明这套消融覆盖了哪些质疑 - **Unnecessary Ablations**明确列出看似有用但不增加洞察的实验并跳过是控制预算的关键手段 - **Run Order**按最大化早期信息量排序让最可能推翻/支撑核心主张的实验先跑 - **Estimated Compute**给出总 GPU 小时估算供 Step 4 的预算审查使用。 ## 六、Step 4CC 审查可行性Feasibility Review 在设计完成、动手运行之前CC 必须做四类可行性审查[skills/ablation-planner/SKILL.md#L99-L105](https://link.gitcode.com/i/d9cd16fb2049ae656657dd4b9d8d05fe) 1. **计算预算Compute budget**现有 GPU 是否承担得起全部消融 2. **代码改动Code changes**哪些消融需要改代码、哪些只需要改配置 3. **依赖关系Dependencies**哪些消融可以并行运行 4. **削减方案Cuts**若预算紧张提议删除低优先级消融并请 Codex 确认/重新排优先级。 注意第 4 点的措辞**提出削减并请 Codex 确认**而不是 CC 单方面静默丢弃实验技能 Rules 中也重申了这一点。这与整条流水线的评审者决策哲学一致——预算权衡属于工程设计判断但最终优先级调整仍要回到评审者那里确认避免 CC 因工程便利而擅自牺牲论文证据完整性。 ## 七、Step 5实现与运行Implement and Run 技能原文给出的落地五步[skills/ablation-planner/SKILL.md#L107-L113](https://link.gitcode.com/i/f91069a829e71feff451ced7277bc7a4) 1. **先做配置类改动**为每个消融创建 configs/scriptsconfig-only 改动优先更快、更不易出错 2. **冒烟测试**每个消融在完整运行前先跑小规模冒烟测试 3. **按建议顺序运行**并使用描述性命名如 ablation-no-module-X 4. **在 EXPERIMENT_LOG.md 中记录结果** 5. **全部消融完成后将洞察更新到 findings.md**。 关于运行这一环仓库提供了与之配套的工程化工具链 - 若消融规模较大≥10 个任务、多 seed、多 wave、OOM 重试、teacher→student 链式依赖应使用 [experiment-queue 技能](https://link.gitcode.com/i/bc9c1578190d287b4733dde0b78384f4)它通过 skills/experiment-queue/scripts/queue_manager.pytools/experiment_queue/ 下保留 os.execv 兼容 shim在远程 GPU 服务器上以 nohup 方式运行独立调度器支持 manifest.json 显式任务列表、grid 网格自动展开、基于 expected_output 文件的完成判定、CUDA OOM 检测与有界重试、stale screen 清理、wave 过渡与 depends_on 阶段编排 - 若任务较少≤5 个直接使用 [run-experiment 技能](https://link.gitcode.com/i/8af1b3f949c2d1ecf1ce1a501dbc054c)它覆盖本地 GPU、远程 SSH、Vast.ai、Modal serverless 四种环境的部署与验证 - 实验记录则遵循 [EXPERIMENT_LOG_TEMPLATE.md](https://link.gitcode.com/i/fcc2dd6e5544e71501548b243a4780e4)每个实验包括失败与负结果都要写 Setup / Results 表格 / Verdict / Reproduction 命令 / WandB 链接作为我们到底跑了什么、发生了什么的权威来源。 ## 八、Rules 逐条解读消融实验的纪律红线 技能末尾的 Rules 是该技能可操作性的精华逐条理解如下原文见 [skills/ablation-planner/SKILL.md#L115-L123](https://link.gitcode.com/i/d05ddd279ad5163a0f3809bd8b398a83) 1. **Codex 主导设计CC 不预过滤、不带偏**消融清单。Codex 像审稿人一样思考CC 像工程师一样思考。 2. **每个消融必须有明确的 what_it_tests 和 expected_if_component_matters**禁止just try it式实验。 3. **配置类消融优先于需要改代码的消融**更快、更不易出错。 4. **总计算量超出预算时CC 提出削减并请 Codex 重新排优先级不静默丢弃**。 5. **组件消融remove/replace优先于超参扫描**。 6. **不为与基线相同的组件生成消融**避免 no-op 消融。 7. **所有消融结果都要记入 EXPERIMENT_LOG.md包括负结果**——移除组件后性能无变化本身就是一个重要发现。 第 7 条尤其值得强调ARIS 的整套评审体系包括 [result-to-claim 技能](https://link.gitcode.com/i/9fd79948054f52b584883a8a084a8993) 与 [auto-review-loop 技能](https://link.gitcode.com/i/e77c25b0f1442540d909fb3ad156afeb)都反复强调诚实记录负结果、不隐藏缺陷以换取高分消融实验中的负结果往往比正结果更能帮助作者收敛主张范围或调整方向。 ## 九、在完整流水线中的位置与其他技能的组合 从源码结构看ablation-planner 处于 ARIS 研究工作流的证据补全阶段其上下游协作关系可以概括为/experiment-planclaim 驱动的实验路线图含消融矩阵设计 ↓ /run-experiment 或 /experiment-queue执行 ↓ /result-to-claim结果判定claim_supported yes / partial / no ↓ /ablation-planner本技能评审者视角设计消融并运行 ↓ 论文写作/paper-plan、/paper-write 等赞分享AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep点击查看免费下载相关推荐Ablation PlanAblation Plan Component Ablations highest priority | | Name | What It Tests | ExAI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginImplementation PlanImplementation Plan Affected paths : src/db/ 、 src/config/database.ts 、 tests/in人工智能AI 应用AI Agent工具调用MCP ClientsLaunch PlanLaunch Plan TODOs First x Done already Second 它虽然只有五行业务内容却浓缩了整套续跑机制的两个关键事实 1.人工智能AI Agent代码智能体多智能体MCP ClientsAgent 编排上一篇Awesome F 项目教程下一篇Kisso轻量级Java单点登录SSO框架指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考