ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Llama Models 完整指南:10分钟下载、量化并跑通 Llama 2–4 开源大模型

2026/9/20 22:05:44 拓冰建站 浏览量
Llama Models 完整指南:10分钟下载、量化并跑通 Llama 2–4 开源大模型 Llama Models 完整指南10分钟下载、量化并跑通 Llama 2–4 开源大模型【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models拿到 Llama 4 的签名下载链接后第一个卡住你的问题往往不是怎么下载而是要几张卡才跑得动。llama-models 是 Meta 官方的 Llama 模型工具包一个llama-model命令搞定全部模型的检索与下载多 GPU 跑 Llama 4 的 MoE 大模型再用 FP8/Int4 量化把 80GB 模型压进单卡。本文带你 10 分钟看懂它、跑通它。一图看懂 llama-models 能力全景从下载权重到跑推理这个仓库交付的东西分两层很多人会看混llama_models/可pip install的包PyPI 包名llama_models当前版本 0.2.0核心是llama-model命令行工具负责找模型、下模型、验模型、删模型models/推理代码目录models/llama4/scripts/ 和 models/llama3/scripts/ 里是可直接torchrun的推理脚本跑模型时需要把仓库根目录加进PYTHONPATH。整体能力地图如下覆盖的模型阵容来自 README 与 llama_models/sku_list.py从 Llama 2 一路排到 Llama 4模型发布日期规格上下文TokenizerLlama 22023-07-187B / 13B / 70B4KSentencepieceLlama 32024-04-188B / 70B8KTikToken-basedLlama 3.12024-07-238B / 70B / 405B128KTikToken-basedLlama 3.22024-09-251B / 3B另有 Vision 11B / 90B128KTikToken-basedLlama 3.32024-12-0470B128KTikToken-basedLlama 42025-04-05Scout-17B-16E / Maverick-17B-128E10M / 1MTikToken-based发布节奏一目了然读完这一节你能带走一个结论下载管理找 CLI跑推理找models/目录两者配套使用。技术决策深挖MoE、混合量化与视觉交叉注意力亮点一MoE 混合专家Llama 4 如何用 17B 激活参数承载超大模型大白话讲 MoEMixture of Experts混合专家它像一家有 16 位专科医生的医院每个 token 只被分诊给其中几位专家看诊所以总编制很大但每次看病每次推理只动一小部分参数——容量大、计算省。Llama 4 Scout 有 16 个专家17B-16EMaverick 有 128 个17B-128E。专家网络的路由和分发由 models/llama4/moe.py 实现每个专家独立持有 SwiGLU 的三组权重# models/llama4/moe.py 中 Experts 的加载钩子节选 def load_hook(self, state_dict, prefix, strict, missing_keys, unexpected_keys, error_msgs): self.prefix prefix if prefix moe_w_in_eD_F in state_dict: e self.num_local_experts D self.dim # 检查点里是融合命名这里 reshape 成 w1/w2/w3 三组专家权重 state_dict[prefix w1] state_dict.pop(prefix moe_w_in_eD_F).view(e, D, -1) state_dict[prefix w2] state_dict.pop(prefix moe_w_out_eF_D).view(e, -1, D) state_dict[prefix w3] state_dict.pop(prefix moe_w_swiglu_eD_F).view(e, D, -1)注意专家权重会按 fairscale 的模型并行世界大小切分到各 GPUdivide_exact(hidden_dim, divide_factor)这就是为什么 Llama 4 官方脚本用torchrun起多卡——专家天然可分摊。亮点二FP8/Int4 混合量化把多卡模型压进一张卡量化可以类比为照片有损压缩用一点细节换更小体积。llama-models 的做法是混合精度——只把 MoE 专家层的权重压成 FP8 或 Int4激活值保持 bfloat16精度损失很小。具体策略见 models/llama4/quantization/loader.py# models/llama4/quantization/loader.py节选 def should_quantize_block(block: nn.Module) - bool: is_moe isinstance(block.feed_forward, MoE) if quantization_mode QuantizationMode.fp8_mixed: # 只量化 MoE 专家层且跳过首尾两层 return is_moe and not (block.layer_id 0 or block.layer_id (model.n_layers - 1)) return is_moe对 Llama-4-Scout-17B-16E-Instruct 而言不同精度下需要的硬件差距巨大数据来自 README推理模式权重形态GPU 需求bf16 全精度不压缩≥ 4 × 80GBfp8_mixedMoE 专家 FP8 bf16 激活2 × 80GBint4_mixedMoE 专家 Int4 bf16 激活1 × 80GB一个参数--quantization-mode就能在三种档位之间切换这是资源有限但想用旗舰模型的人最值钱的开关。亮点三视觉交叉注意力Llama 3.2 Vision 如何看图很多多模态模型把图片切成一堆 token 塞进序列Llama 3.2 Vision 不是——models/llama3_2/vision_prompt_format.md 明确说明它不是 early fusion 模型图片不进 token 序列而是由独立的 Vision Encoder 提取特征从侧边喂给文本层之间的 Cross Attention Layer交叉注意力。对使用者的影响是提示词里只需一个占位标签|begin_of_text||start_header_id|user|end_header_id| |image|Describe this image in two sentences|eot_id||start_header_id|assistant|end_header_id|文档同时提醒|image|标签只影响其后的文本 token建议一个 prompt 里放一张图。零基础上手五步完成安装、下载、校验到首次推理第一步准备环境并安装 CLI要求 Python ≥ 3.10见 pyproject.toml 的requires-python。基础依赖很轻PyYAML、jinja2、tiktoken、pydantic、Pillow、rich、httpx 等不装 PyTorch 也能用 CLI。pip install llama-models llama-model --help # 验证应打印 list/describe/download 等子命令 llama-model list # 验证打印带模型 ID 和上下文长度的表格llama-model list能正常输出表格说明 CLI 就位。想看含旧版本的全量清单加--show-all。第二步检索并下载模型权重官方下载流程见 README先到 Meta Llama 官网的下载页阅读并接受许可协议审批通过后会收到一封带签名 URL的邮件再用 CLI 拉取。链接 24 小时后过期且下载次数有限失效后重新申请即可。llama-model list # 确认要下的模型 ID llama-model download --source meta \ --model-id Llama3.2-1B # ID 以 list 输出为准支持逗号分隔多个 llama-model download --source huggingface \ --model-id Llama3.2-1B --hf-token YOUR_TOKEN # 备选从 Hugging Face 拉取权重默认落在~/.llama/checkpoints/模型目录/包含consolidated.00-07.pth、tokenizer.model、params.json等文件文件清单由 llama_models/sku_list.py 的llama_meta_net_info生成。第三步验证下载完整性大文件下载最怕看起来下了其实坏了。CLI 内置校验llama-model verify-download # 校验已下载模型的文件完整性 llama-model list --downloaded # 验证列出本地模型、占用 GB 数和修改时间verify-download无报错、list --downloaded能看到带 GB 大小的模型行即可进入推理。第四步跑通第一次 Llama 4 多 GPU 对话先 clone 推理代码再装 torch 扩展依赖git clone https://gitcode.com/GitHub_Trending/ll/llama-models cd llama-models pip install .[torch] # torch/torchvision/fairscale/fire/blobfile/fbgemm-gpu-genai然后按 README 的脚本跑 chat_completionLlama 4 全精度需 4 卡NGPUS4 CHECKPOINT_DIR~/.llama/checkpoints/Llama-4-Scout-17B-16E-Instruct PYTHONPATH$(git rev-parse --show-toplevel) \ torchrun --nproc_per_node$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS脚本内置了几组示例对话包括用仓库自带的示例图片models/resources/pasta.jpeg 等做看图写俳句的多模态测试成功标志终端依次打印每组对话的 User/Assistant 轮次最后一条会输出结合两张图狗和意大利面的俳句。跑 Base非 Instruct模型时把脚本换成-m models.llama4.scripts.completion并改CHECKPOINT_DIR。第五步用量化推理把卡数砍下来如果卡不够加一个参数即可GPU 需求对照上节表格MODEfp8_mixed # 或 int4_mixedfp8 需 2×80GBint4 需 1×80GB NGPUS2 PYTHONPATH$(git rev-parse --show-toplevel) \ torchrun --nproc_per_node$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS --quantization-mode $MODE装好 pip 包后pyproject.toml注册的入口命令如llama4_chat_completion、example_chat_completion也可直接调用无需手动拼torchrun参数。选型建议与高频问题 FAQ按场景挑对模型先按场景对号入座你的场景推荐模型说明边缘设备、快速实验Llama 3.2 1B / 3B单权重文件还有 INT4 量化变体可选单卡日常推理Llama 3.1 8B / 70B128K 上下文生态最成熟看图说话、多模态Llama 3.2 Vision 11B/90B、Llama 4交叉注意力视觉架构超长上下文百万级Llama 4 Scout10M 上下文最强综合能力、预算充足Llama 4 Maverick / 3.3 70BMoE 128 专家 / 128K高频问题下载报403: Forbidden签名链接 24 小时过期且下载次数有限回官网重新申请链接即可不是模型文件问题。Llama 4 显存放不下加--quantization-mode fp8_mixed2×80GB或int4_mixed1×80GB官方只承诺 Scout 的这三档硬件需求。llama-model和models/目录什么关系前者是 pip 包里的下载管理 CLI后者是torchrun -m models.xxx用的推理代码跑推理必须设PYTHONPATH指向仓库根目录。能在 Hugging Face 上下载吗能llama-model download --source huggingface --hf-token ...README 也说明 HF 仓库提供 transformers 格式和 nativellama4格式两种权重。提示词格式搞不定用llama-model prompt-format -m MODEL_ID直接查看该模型的官方提示词模板各版本的格式文档在 models/llama3_2/text_prompt_format.md、models/llama4/prompt_format.md 等处。收尾llama-models 的价值在于官方出品、权重下载有校验、Llama 4 的 MoE 与量化推理开箱即用。下一步就做一件事——pip install llama-models后跑llama-model list看清单从 Llama 3.2 1B 起步把下载、校验、推理全流程走一遍再升级到 FP8 量化跑 Llama 4。【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考