ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Quick Reference · Gemma 4 多模态开放权重大模型完全速查

2026/9/14 6:46:47 拓冰建站 浏览量
Quick Reference · Gemma 4 多模态开放权重大模型完全速查 Quick Reference · Gemma 4 多模态开放权重大模型完全速查【免费下载链接】reference面向开发者的技术速查清单Cheat Sheets集合整理常见技术、工具与开发流程帮助快速查阅关键信息提高开发效率。项目地址: https://gitcode.com/GitHub_Trending/referen/reference本文以 Quick Reference开发者技术速查清单中的 Gemma 4 备忘清单 为核心骨架系统梳理 Google DeepMind 基于 Apache 2.0 发布的 Gemma 4 开放权重多模态大模型家族从四个规模型号的选型与显存预算到混合注意力、PLE、p-RoPE、MoE 等架构特性再到 Thinking 推理模式、多模态输入规范、HuggingFace/Ollama/vLLM/云端部署与 QLoRA 微调实战。读完本篇你可以独立完成 Gemma 4 的本地推理、按需选型、开启思维链推理、处理图文音视频输入并以极低成本完成领域微调。Gemma 4 概览Gemma 4 是 Google DeepMind 推出的开放权重open-weight多模态大语言模型家族覆盖从移动端边缘部署到服务器级部署的四种规模并具备前沿智能能力。其关键事实如下开源许可Apache 2.0可自由用于商业与二次开发发布2026-03-31基于 Gemini 3 研究构建语言覆盖支持 140 语言家族规模E2B / E4B边缘与 31B / 26B A4B服务器共四档。在本速查清单中Gemma 4 归属于 AI 板块与 ChatGPT、Claude、Gemini CLI、Grok 等并列定位为面向开发者的大模型本地化落地速查。快速上手与安装依赖安装Gemma 4 的权重均通过 HuggingFace 以google/model-id形式分发。本地推理的核心依赖为$ pip install -U transformers torch accelerate型号与 Model ID规格Model IDE2Bgemma-4-E2B-itE4Bgemma-4-E4B-it31Bgemma-4-31b-it26B A4Bgemma-4-26b-a4b-it端到端推理示例以下是最小可运行的 Transformers 推理链路加载 processor 与模型、套用 chat template、生成并解析响应。注意enable_thinking参数与parse_response的返回值语义thinking为内部推理链response为面向用户的最终回答。from transformers import AutoProcessor, AutoModelForCausalLM import torch MODEL_ID google/gemma-4-E4B-it processor AutoProcessor.from_pretrained(MODEL_ID) model AutoModelForCausalLM.from_pretrained( MODEL_ID, dtypetorch.bfloat16, device_mapauto ) messages [ {role: system, content: You are helpful.}, {role: user, content: Explain MoE briefly.}, ] text processor.apply_chat_template( messages, tokenizeFalse, add_generation_promptTrue, enable_thinkingFalse ) inputs processor( texttext, return_tensorspt ).to(model.device) input_len inputs[input_ids].shape[-1] outputs model.generate(**inputs, max_new_tokens512) response processor.decode( outputs[0][input_len:], skip_special_tokensFalse ) result processor.parse_response(response) # result[thinking] → 内部推理链 # result[response] → 展示给用户的最终回答推荐采样参数官方给出的一组稳定采样配置如下建议作为默认起点参数值temperature1.0top_p0.95top_k64最佳实践要点任意提示中都应将图片/音频放在文本之前硬性顺序要求多轮对话时在历史中省略思考块thought blocks训练数据中包含 75% 的 CoT 数据以保持推理能力仅文本微调时冻结视觉层。模型规格与架构特性四档型号规格Gemma 4 家族的四款型号在架构、参数、上下文与模态上的差异如下模型架构总参数每 Token 激活层数上下文模态E2BDensePLE5.1B (2.3B eff)2.3B35128KTextImageAudioE4BDensePLE8B (4.5B eff)4.5B42128KTextImageAudio31BDense30.7B30.7B60256KTextImage26B A4BMoE25.2B3.8B30256KTextImage补充参数滑动窗口为 512 tokensE2B/E4B、1024 tokens31B/26B词表为 262K全模型一致。注意 E2B/E4B 的每 Token 激活显著小于总参数这正是 PLE 带来的有效计算量下降见下。架构特性混合注意力Hybrid AttentionLocal层使用滑动窗口512 或 1024 tokensGlobal层全局上下文与 local 层交错排列最后一层始终是 global attention 层。这种 local/global 交错设计在控制 KV 成本的同时保留了长程依赖能力。PLE — 边缘模型E2B/E4BPer-Layer Embeddings 是边缘档的核心降本机制每个解码层都拥有自己的小型 embedding 表大型静态表通过快速查表实现不走稠密矩阵乘法因此有效计算参数远小于加载总参数E2B 总 5.1B 而每 token 仅激活 2.3B可在1.5 GB 以下 VRAM4-bit 量化进行推理。p-RoPE Shared KV Cache在 global 层使用 Proportional RoPEp-RoPE提升长程一致性global 层共享 KV Cache降低峰值显存占用在 256K 上下文下保持稳定性能。MoE — 26B A4B128 个专家 1 个始终激活的共享专家推理时每个 token 激活 8 个专家A4B即约 4B 激活量速度接近 4B 稠密模型质量接近 30B视觉编码器约 5.5 亿参数与 31B 相同。显存需求下表给出不同精度下的基础权重显存不含 KV cache 额外占用是选型时的第一道门槛模型BF1616-bit8-bit4-bitE2B9.6 GB4.6 GB3.2 GBE4B15 GB7.5 GB5 GB31B58.3 GB30.4 GB17.4 GB26B A4B48 GB25 GB15.6 GB注意以上仅为权重显存。实际部署时还需为 KV cache 预留额外空间长上下文与批量并发下该部分占比会上升。按 VRAM 选型建议可用 VRAM推荐模型 5 GBE2B (4-bit)5–8 GBE4B (4-bit)15–20 GBE4B (BF16)24–32 GB31B (4-bit)48–80 GB31B (BF16)高吞吐场景26B A4B选型逻辑先按激活参数/权重显存确定可承载的型号档位再按是否需要音频仅 E2B/E4B与是否追求高吞吐26B A4B做最终取舍。基准测试以下结果均基于启用 thinking 模式的指令微调模型。核心基准基准项31B26B A4BE4BE2BGemma 3 27BMMLU Pro85.2%82.6%69.4%60.0%67.6%MMMLU (multilingual)88.4%86.3%76.6%67.4%70.7%AIME 2026 (math)89.2%88.3%42.5%37.5%20.8%GPQA Diamond84.3%82.3%58.6%43.4%42.4%LiveCodeBench v680.0%77.1%52.0%44.0%29.1%Codeforces ELO21501718940633110BigBench Extra Hard74.4%64.8%33.1%21.9%19.3%Tau2 avg (agentic)76.9%68.2%42.2%24.5%16.2%HLE no tools19.5%8.7%———HLE with search26.5%17.2%———31B 与 26B A4B 在数学、推理、代码与 agentic 任务上接近且显著领先上一代 Gemma 3 27BE4B/E2B 则随规模收缩而能力相应下降适合轻量与端侧场景。视觉基准基准项31B26B A4BE4BE2BMMMU Pro76.9%73.8%52.6%44.2%MATH-Vision85.6%82.4%59.5%52.4%MedXPertQA MM61.3%58.1%28.7%23.5%OmniDocBench↓0.1310.1490.1810.290其中OmniDocBench为文档编辑距离越低越好↓。长上下文基准项31B26B A4BE4BE2BMRCR v2 128K66.4%44.1%25.4%19.1%长上下文能力与规模正相关31B 在 128K 检索任务上的表现最稳。Arena AILMSYS ELOModelELOOpen RankGemma 4 31B1452#3Gemma 4 26B A4B1441#6Thinking 模式Gemma 4 支持思考块thought blocks模型可先输出对用户隐藏的内部推理再给出最终回答。开发者可通过enable_thinking与 system prompt 开头的标记来控制。启用 Thinking在 system prompt开头加上|think|并设enable_thinkingTruemessages [ { role: system, content: |think|You are a math expert. }, {role: user, content: Solve: 3x 7 22} ] text processor.apply_chat_template( messages, tokenizeFalse, add_generation_promptTrue, enable_thinkingTrue ) outputs model.generate(**inputs, max_new_tokens2048) response processor.decode( outputs[0][input_len:], skip_special_tokensFalse ) result processor.parse_response(response) # result[thinking] → 分步推理 # result[response] → 最终回答Thinking 输出结构开启时响应在 token 层面由思考块与回答块组成|channelthought [内部逐步推理 - 对用户隐藏] channel| [对用户可见的最终回答]关闭 thinking 时的行为差异对 31B / 26B A4B 来说即使enable_thinkingFalse仍会输出空标签|channelthought channel| [最终回答]而 E2B/E4B 在关闭时会完全跳过空标签。解析层应对此做兼容处理用parse_response统一处理最稳妥。控制 TokenToken作用\|think\|在 system prompt 启用 thinking\|channelthought\n打开内部思考块channel\|关闭思考块\|turn打开一轮对话turn\|关闭一轮对话多轮对话规则不要把 thought 内容写入会话历史仅将result[response]作为模型轮次内容传回复杂推理任务建议提高max_new_tokensAIME、证明题、调试等任务建议enable_thinkingTrue。多模态输入Gemma 4 的多模态输入遵循一条硬性顺序规则图片/音频必须放在文本之前。违反顺序会导致对齐问题。图片输入支持可变宽高比 可配置的视觉 token 预算按任务复杂度选择预算适用场景70快速分类、视频帧140图像描述、缩略图280通用图像理解560图表、示意图1120OCR、PDF 解析、细节识别# 图片必须在文本之前硬性要求 messages [{role: user, content: [ {type: image, image: image}, {type: text, text: Describe this chart.}, ]}] inputs processor( texttext, imagesimage, return_tensorspt ).to(model.device)视觉编码器规模约 1.5 亿参数E2B/E4B、约 5.5 亿参数31B/26B。音频输入仅 E2B 与 E4B 支持约 3 亿参数音频编码器音频最长30 秒支持任务ASR语音识别与语音翻译。ASR 提示词模板Transcribe the following speech in {LANGUAGE} into {LANGUAGE} text.翻译提示词模板Transcribe in {SRC_LANG}, then translate to {TARGET_LANG}.视频输入视频按连续图像帧处理最大60 秒1 fps 即 60 帧每帧建议使用低 token 预算70–140E2B/E4B 可同时处理音轨。# 将帧作为图像列表传入 inputs processor( texttext, images[frame1, frame2, ..., frame60], return_tensorspt )模态顺序正确 vs 错误# ✅ 正确顺序图片在前 content [ {type: image, image: img}, {type: text, text: Describe it.}, ] # ❌ 文本在前会导致对齐问题 content [ {type: text, text: Describe it.}, {type: image, image: img}, ]部署方案HuggingFaceTransformers$ pip install -U transformers accelerateBF16默认精度from transformers import ( AutoProcessor, AutoModelForCausalLM ) import torch mid google/gemma-4-31b-it processor AutoProcessor.from_pretrained(mid) model AutoModelForCausalLM.from_pretrained( mid, torch_dtypetorch.bfloat16, device_mapauto )4-bit 量化显存受限时启用from transformers import BitsAndBytesConfig bnb BitsAndBytesConfig(load_in_4bitTrue) model AutoModelForCausalLM.from_pretrained( mid, quantization_configbnb, device_mapauto )Ollama$ ollama pull gemma4 # 31B默认 $ ollama pull gemma4:e4b # 边缘 4B 版本 $ ollama pull gemma4:e2b # 边缘 2B 版本 $ ollama run gemma4 # 交互聊天自定义 GGUFModelfileFROM /path/to/fine-tuned.gguf SYSTEM You are a coding assistant.$ ollama create mygemma -f Modelfile $ ollama run mygemmavLLM Server以 OpenAI 兼容 API 方式对外提供服务$ vllm serve google/gemma-4-31B-it \ --max-model-len 8192 \ --enable-auto-tool-choice \ --tool-call-parser gemma4 \ --reasoning-parser gemma4OpenAI 兼容 API 地址http://localhost:8000/v1。注意--tool-call-parser与--reasoning-parser均指向gemma4分别对应工具调用与思维链解析。云端与 API 平台平台说明Gemini APIgemma-4-31b-itAI Studio浏览器 PlaygroundVertex AI自定义端点Cloud RunServerless GPUGKE vLLM自动伸缩边缘与移动端运行时适用场景AICore (Android)系统级 APILiteRT-LMIoT、Raspberry PiAI Edge Gallery端侧评测LM Studio桌面图形界面llama.cppCPU/GPU 混合微调QLoRA 配置单卡 16 GB在单张16 GB GPU如 T4 / 免费 Colab / Kaggle上即可完成边缘档微调from unsloth import FastModel model, tokenizer FastModel.from_pretrained( google/gemma-4-E4B-it, load_in_4bitTrue, max_seq_length4096 ) model FastModel.get_peft_model( model, r16, lora_alpha16, lora_dropout0, target_modules[ q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj ], )视觉微调E2B / E4B仅微调语言侧、冻结视觉编码器from unsloth import FastVisionModel model, tokenizer FastVisionModel.from_pretrained( google/gemma-4-E4B-it, finetune_vision_layersFalse, # 冻结视觉编码器 finetune_language_layersTrue, load_in_4bitTrue, )MoE 微调26B A4B对于26B A4B全量微调会破坏专家路由需格外谨慎仅使用LoRA bf16不要做 FFT 全量微调建议从r16、lora_alpha16起步在 loss 收敛后再逐步增大上下文长度避免训练专家路由相关权重矩阵。数据要求要求建议值CoT 数据占比≥ 75% 的训练集Thinking 格式包含\|think\|触发标记多模态顺序图片/音频在文本前Chat 模板ShareGPT 或 OpenAI 格式RL 奖励可验证的最终答案视觉微调建议分步策略先冻结视觉层—finetune_vision_layersFalse仅微调 LLM attention MLP projector解冻前先验证文本域质量仅在领域图像任务中解冻视觉层训练时使用较低 token 预算70–280可节省 VRAM。Gemmaverse 生态专项模型围绕 Gemma 系列有一批面向垂直领域的专项模型模型领域说明MedGemma 4B医学影像多模态 X-ray/MRI 分析MedGemma 27B临床文本EHR 医疗报告推理CodeGemma编程代码补全与重构PaliGemma 2视觉语言细粒度 VLM 与视觉推理ShieldGemma安全LLM 输出安全分类器DataGemma事实数据基于 Google Data Commons 对齐FunctionGemma工具调用低资源函数调用解析生态库与社区库与框架ADKAgent Development KitJAX Gemma Librarygoogle-deepmind/gemmaGemma Cookbookgoogle-gemma/gemma-cookbookgoogle/adk-samplesstarter agents。社区变体100K 社区微调衍生模型RecurrentGemmaGriffin 架构EmbeddingGemma、T5Gemma 2VaultGemma差分隐私。延伸阅读与速查定位Gemma 4 备忘清单本身还汇总了若干官方与社区入口供读者继续深入此处以名称指代具体以清单内标注为准官方文档、模型卡model card、DeepMind 模型页、HuggingFace 组织页、Gemma 实战手册Cookbook、JAX Gemma 库、vLLM 使用指南、Ollama 模型库。本速查在 Quick Reference 中的位置本篇内容源自 Gemma 4 备忘清单它是 Quick Reference 这份为开发者整理的技术栈速查清单中 AI 板块的一员。该仓库以 Markdown 清单 构建工具的形式组织从仓库结构看package.json 定义了refs-cli构建与markdownlint校验流程清单通过npm startrefs-cli --watch实时生成 HTML、npm run build产出dist静态站点netlify.toml 配置了npm run build并发布distDockerfile 则基于静态站点基础镜像把dist打包为可部署镜像。这意味着 Gemma 4 等清单内容可直接随站点被检索、渲染与二次部署方便团队内分享这份大模型落地速查。【免费下载链接】reference面向开发者的技术速查清单Cheat Sheets集合整理常见技术、工具与开发流程帮助快速查阅关键信息提高开发效率。项目地址: https://gitcode.com/GitHub_Trending/referen/reference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考