ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

parameter-golf 架构创新全解:SmearGate、XSA、U-Net 跳跃与并行残差如何突破 16MB 性能瓶颈

2026/9/2 12:40:38 拓冰建站 浏览量
parameter-golf 架构创新全解:SmearGate、XSA、U-Net 跳跃与并行残差如何突破 16MB 性能瓶颈 parameter-golf 架构创新全解SmearGate、XSA、U-Net 跳跃与并行残差如何突破 16MB 性能瓶颈【免费下载链接】parameter-golfTrain the smallest LM you can that fits in 16MB. Best model wins!项目地址: https://gitcode.com/gh_mirrors/pa/parameter-golfparameter-golf 是 OpenAI 发起的模型工艺挑战赛在16MB 极限体积内训练一个语言模型用压缩指标bits per byte比拼质量。为了在如此苛刻的约束下榨出每一分性能参赛者发明了SmearGate、XSA 注意力、U-Net 跳跃连接、并行残差等一系列巧妙的架构创新。本文面向新手用通俗语言带你读懂这四大技术是如何一步步把分数从 1.22 压到 1.06 的 ️什么是 Parameter Golf16MB 极限挑战的规则和普通训练一个 GPT的任务不同这里有三重硬约束约束内容 体积模型 代码压缩后 ≤ 16,000,000 字节⏱️ 时间在 8×H100 上 10 分钟内完成训练 评测用 FineWeb 验证集上的bits per byte每字节比特数计分越低越好这意味着你没法靠堆参数取胜只能靠架构设计、低精度量化、训练技巧。仓库中的 records/track_10min_16mb/ 目录按时间保存了每一次创纪录提交像一部完整的进化史。SmearGate把上文信息免费注入嵌入层它解决什么问题Transformer 理解前后两个词的关系如苹果 手机需要自注意力花一层层的计算去发现。SmearGate 的思路是别等注意力去学直接在嵌入层就把相邻两个 token 的信息混起来。原理超简单它只学习约 512 个参数每维一个门控系数把当前 token 的嵌入与前一个 token的嵌入按权重融合gate sigmoid(gate) # 每维一个门初始 ≈ 0.95 output gate * current_emb (1 - gate) * prev_token_emb初始值让模型几乎只看当前 token随后每个维度自己学习该混合多少上文。配合一个小型BigramHash哈希表把相邻词对映射到可学习嵌入模型相当于免费获得了二元组特征。实现可见 SmearGate 门控定义完整说明见 SmearGate 提交文档。 一个容易被忽略的细节在打包的评测流里SmearGate 会把上一篇文章的末尾 token漏进下一篇文章的开头。冠军方案用not_bos掩码修复了这个泄漏见 BOS 修复说明。XSA几乎零成本削弱自注意力偏置什么是自注意力偏置研究发现深层注意力输出总会残留一部分自己看自己的成分输出与自身 Value 的余弦相似度逐层升高这会降低信息混洗效率。XSAExclusive Self Attention的解法很直白从注意力输出中减去它在自身 Value 上的投影把自注意力成分剔除# 从输出 y 中减去 y 在归一化 value v 上的投影 y y - dot(y, v̂) * v̂这个操作不引入任何新参数。参赛者还做了两点工程优化详见 XSA 提交文档GQA 感知实现用 reshape 广播代替张量复制把每步开销从 ~7ms 降到 ~2ms见 _xsa_efficient 实现。只在需要的层启用先只在最深的 3 层启用XSA_LAST_N3后来验证扩展到全部 11 层仍能获益因为第 0 层就开始混洗跨位置信息也有价值。最终 XSA 全层 自生成 GPTQ 校准方案 把分数推进到 1.1147 BPB。U-Net 跳跃连接给深层网络加快速通道从图像模型借来的结构经典 Transformer 只有一条残差流信息从第 0 层逐层传到最后一层越靠后的表示离输入越远。参赛者把深层栈改造成U-Net 式的编码器-解码器结构前一半层作为编码器后一半层作为解码器对应的编码器/解码器层之间用可学习的跳跃权重直接相连逐维缩放 门控融合。这样解码器不必依赖漫长的残差流可以直接复用浅层的早期特征——就像图像分割 U-Net 把边缘细节直接传给深层一样。在 11 层网络中即5 编码 6 解码跳跃融合的数学表达lerp(可学习缩放后的浅层特征, 当前表示, 门控)见 跳跃应用实现。 跳跃连接是跨方案复用的基础设施从 22M 参数的小模型SmearGate 方案到 73.7M 三值量化的宽模型U-Net Ternary 方案再到最终 1.0611 BPB 的冠军栈它都稳定存在。并行残差把一条单行道改造成双车道传统残差流的问题标准结构里注意力子层和 MLP 子层共用同一条残差流串行读写彼此容易互相干扰。并行残差从某一层开始如第 7 层把流拆成两条车道车道 A注意力子层读写车道 BMLP 子层读写每个子层用可学习的路由权重决定往两条车道各写回多少。有意思的是学出来的路由高度不对称——MLP 几乎不往注意力车道写回权重低至 0.01。这一改动在当时基线上单独贡献了约 0.002 BPB 的收益是当次提交中单项最大增益完整分析含逐层路由权重表见 并行残差提交文档。双车道结构与 U-Net 跳跃可以组合跳跃特征同时注入两条车道见 并行跳跃实现。量化与压缩架构创新的另一半天花板架构创新省下的体积最终要换成更低的精度。理解这一点可以看这张权重分布对比图原始权重近似高斯分布a量化到 int5b或 int4c后误差明显而三值量化d几乎只用 3 个离散值——这就是为什么权重分布越紧凑、越对称压缩空间越大。配合架构侧的创新压缩侧常用招式包括QAT / GPTQ训练中就用 int6 假量化STE或训完后用完整 Hessian 的 GPTQ 校准zstd-22 / LZMA / brotli等高强度压缩把量化后的权重再压一轮权重衰减Muon decoupled WD让权重分布更紧间接提升压缩率。评测技巧滑窗评测与 TTT 消融视角除了训练评测本身也是竞技场。LoRA TTT 消融实验 用这张图直观展示了不同评测策略下文档位置 → BPB曲线切块评测在上下文窗口边界处出现尖峰而滑窗评测stride 分片 长上下文明显更平滑、更低测试时训练LoRA TTT进一步压低曲线。leaderboard 进化路线四大技术如何层层叠加把这些创新放在排行榜的时间轴上可以清楚看到叠加式创新的节奏阶段方案val_bpb关键技术起点NaiveBaseline1.22449 层标准 Transformer嵌入创新SmearGate 正交初始化1.1556SmearGate BigramHash U-Net 跳跃注意力创新XSA 全层 GPTQ1.1147XSA-all 自生成 GPTQ 校准结构创新并行残差 微型深度循环1.1063双车道残差 中间层复用巅峰冠军栈1.0611以上全部 TTT 逐组压缩值得品味的一点没有哪一项创新单独一招制胜。SmearGate 提供信号、XSA 提升注意力效率、U-Net 跳跃缩短信息路径、并行残差减少子层干扰——它们互相正交组合起来才把分数从 1.22 一路推到 1.06。新手上手从哪里开始读代码如果你想在本地复现或魔改推荐按这个顺序探索train_gpt.py —— 官方基线训练脚本理解整体训练循环train_gpt_mlx.py —— Apple Silicon 上的轻量入口适合本地试跑data/README.md —— 数据集与分词器准备说明按时间顺序翻阅 records/track_10min_16mb/每个提交文件夹都是README 训练脚本 日志的完整包堪称最好的学习材料。仓库为只读镜像若需要拉取完整源码进行实验可克隆仓库gh_mirrors/pa/parameter-golf后新建分支迭代。结语parameter-golf 的魅力在于当参数预算被锁死在 16MB架构思想就成了唯一的燃料。SmearGate 教你提前注入先验XSA 教你用数学投影免费修正偏差U-Net 跳跃教你缩短信息高速公路并行残差教你让子层各走各的车道。这些技巧都不依赖额外参数却共同改写了一个小模型的极限——这正是 Parameter Golf 作为 L(N) 优化实验最迷人的地方 【免费下载链接】parameter-golfTrain the smallest LM you can that fits in 16MB. Best model wins!项目地址: https://gitcode.com/gh_mirrors/pa/parameter-golf创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考