ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

读懂GEV-26B-Decide:System 1直觉与System 2深思如何协同工作的完整指南

2026/10/8 3:34:24 拓冰建站 浏览量
读懂GEV-26B-Decide:System 1直觉与System 2深思如何协同工作的完整指南 读懂GEV-26B-DecideSystem 1直觉与System 2深思如何协同工作的完整指南【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个基于 Gemma-4-26B 开源的自适应思考决策模型它像人脑一样用 System 1 快速直觉做判断约 45 毫秒遇到不确定的问题再自动切换到 System 2 深度推理最后把两次答案融合成校准过的概率输出。本文带你读懂这套双系统协同机制的工作原理、效果数据与实际使用场景帮助新手快速上手这个决策模型。为什么需要双系统决策模型传统大模型要么秒答但粗糙要么深思但很慢。GEV-26B-Decide 借鉴认知科学中的双过程理论用一个权重、一个引擎解决了这个两难模式特点耗时单请求输出System 1 直觉单次前向传播快速分布约 45 ms每个选项的校准概率自适应思考不确定时才触发 System 2 推理中位数约 7.7 s加速后融合后的校准概率System 2 深思Gemma-4 思考模式逐步推理每秒约 250~438 token文本 / 推理过程 核心卖点同一套权重LoRA 适配器 决策头既可 45 毫秒闪电决策也能按需停下来想。System 1 直觉一次前向传播如何给出概率System 1 的关键设计是**读出来而非生成出来**提问被组织成固定模板[kind] … [state] … [question] … [options] A) … [decision]:模板版本bare-v1取最后一个 token 的隐藏状态通过一个 2,816 → 24 槽位的线性决策头见 head.safetensors按问题类型切出对应槽位、除以校准温度后做 softmax得到每个选项的概率——不生成任何文本槽位布局与读取规则定义在 judge_config.jsonnoul是/否占 2 槽、score0–5 评分占 6 槽、choice多选2–256 个选项占 16 槽。温度校准参数则存放在 calibration.json 中保证说 80% 概率就真的约 80% 准确ECE 仅 0.035。三种决策类型覆盖了绝大多数业务场景noul二分类如客户是否在要求退款choice从 2–256 个选项里选一个超过 16 个时自动分组锦标赛式读取score对状态打 0–5 分System 2 深思只有不确定时才动脑子自适应思考thinking: auto的三步流程是整个模型最精妙的部分先快答System 1 单次前向传播得到概率分布 p1只在不确定时思考若 p1 的领先选项置信度低于阈值默认0.8才让 System 2 用 Gemma-4 思考模式对同一状态、同一问题推理思考长度由think_budget控制融合答案思考结束后读出答案分布 p2最终结果p ½ p1 ½ p2。单独看 p2 近乎一根筋式过度自信等权混合既保住了推理的准确率又保留了 System 1 的校准性这个阈值和混合比例是在 Decision Index 之外的 1,754 道题目上选定的完整数据见 reports/adaptive_validation_summary.json数据集System 1自适应触发思考比例AQuA-RAT数学应用题68.1%89.0%53.9%LogiQA逻辑推理55.3%80.3%63.7%StrategyQA多跳问答68.0%78.7%71.0%OpenBookQA科学常识94.3%96.3%14.7%全部 1,754 题73.3%83.4%47.8%也就是说只让 48% 的题目多想一会儿就拿到了永远思考96% 的收益而校准性几乎不变。思考 token 中位数仅 2,28291.6% 的思考在 8,192 token 预算内完成。实测效果逻辑谜题上从蒙到稳项目自带 reports/thinking_games.json记录了每类 200 道单步谜题的成绩非常直观游戏随机基线System 1自适应触发思考比例扫雷哪个格子绝对安全25.0%21.0%86.0%100%Wordle哪个词符合反馈12.5%52.0%100.0%98%四子棋哪列制胜或防守14.5%54.0%99.5%95%数独高亮格填哪个数11.1%76.0%99.5%92%24 点哪个算式等于 2416.7%89.0%100.0%74%规律很清晰答案可以按规则逐步验证的任务逻辑、约束、算术思考收益巨大而感知类涂鸦识别、反射类Flappy Bird、长程博弈整局 2048思考几乎无帮助——因为每条思考都要花好几秒。在知识推理领域的 10 个基准33,856 次请求上自适应模式把该领域技能分从 0.429 提到0.602GPQA Diamond 从 42.9% 跃升至78.6%完整复算见 reports/decision_index_adaptive.json。⚠️ 但注意分类、检索、工具路由任务建议关闭思考——未经训练的 System 2 有时会自信地改错BANKING77 从 88.0 掉到 85.0。快速上手部署与调用方式部署只需两条命令hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh # vLLM 起在 :8000需 80GB 显存以上单卡serve.sh 启动 serve_decide.py它在一个 vLLM 引擎里同时提供 System 2原生 OpenAI 接口和 System 1 专用的POST /v1/decide路由。请求里传thinking: off | auto | on即可切换模式threshold与think_budget可调节准确率 vs 速度的平衡。vLLM 需要应用 patches/vllm-gemma4-lm-head-lora.patch 来支持 Gemma-4 共享 lm_head 上的 LoRALoRA 权重位于 adapter_vllm/vLLM 路径和 adapter/transformers 路径。性能方面单张 B200System 1 中位数 45 ms、64 并发下 257 决策/秒开启投机解码MTP1 bash serve.sh后思考速度约提升 1.8–1.9 倍延迟中位数从 13.4 s 降到 7.7 s明细见 reports/adaptive_latency_summary.json。不止文本视觉直觉同样在线模型内置 Gemma-4 视觉编码器System 1 和 System 2 都能接收图片。最亮眼的是毫秒级视觉决策计算机操作截图 可点击元素编号框 → 直接选下一步点击60 个多步任务成功率 95%每次点击约 85 ms详见 reports/demos/cu_results.json机械臂抓放摄像头画面 → 每步 61 ms 判断目标在夹爪左/右、上/下完成一次抓取放置仅 4–8 秒模型时间详见 reports/demos/arm_servo.json项目还收录了思考过程演示视频videos/think_minesweeper.mp4、videos/think_connect4.mp4、videos/think_wordle.mp4、videos/think_sudoku.mp4以及 videos/computer_use_shop.mp4 和 videos/robot_arm_pick_place.mp4。总结这套机制适合谁GEV-26B-Decide 的双系统协同本质上是一套成本感知的推理调度器✅适合数学/逻辑/科学推理开auto、意图分类与工具路由关思考、视觉控制回路System 1 极速档、需要置信度门槛的自动化决策用 calibration_gold.json 校准温度⚠️不适合HLE 级专家难题思考也只是回到猜水平、棋盘类长程博弈、128K 以上超长途上下文未测试、高风险无人把关决策一句话记住它的精髓快答打底、不确定再深思、两半混合出概率——用 48% 的思考量换来接近全程深思的效果。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考