ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

零基础入门全模态生成:MiniMax-H3-nvfp4-INT4-INT8-Convrot文本到视频实战

2026/8/6 20:55:37 拓冰建站 浏览量
零基础入门全模态生成:MiniMax-H3-nvfp4-INT4-INT8-Convrot文本到视频实战 零基础入门全模态生成MiniMax-H3-nvfp4-INT4-INT8-Convrot文本到视频实战【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotMiniMax-H3-nvfp4-INT4-INT8-Convrot是一个社区编译的量化与剪枝权重集合专为本地推理环境如ComfyUI优化让普通用户也能轻松体验强大的全模态文本到视频生成能力。通过统一INT4、INT8、混合精度和NVFP4等多种量化格式该项目使拥有16GB - 24GB VRAM消费级GPU的用户能够便捷地探索MiniMax H3的文本、图像、音频到视频的生成功能。 为什么选择MiniMax-H3量化版本全模态生成能力MiniMax H3是一个通用的全模态生成系统支持对文本、图像、视频和音频组成的多模态上下文进行统一理解并能生成带有原生立体声音频的视频分辨率最高可达2K时长最长15秒。其面向任务泛化的系统设计使其在预训练阶段就具备了广泛的多模态上下文理解和生成能力能够出色地遵循复杂的多模态指令。丰富的输入输出规格类别规格输出时长4–15秒输出宽高比支持多种宽高比包括但不限于21:9、16:9、4:3、1:1、3:4和9:16输出分辨率支持多种分辨率尺寸默认将较短边设置为768像素使用H3-Regenerate-2K可实现2K生成输出帧率24 FPS输出音频32 kHz立体声支持对话语言稳定支持11种语言阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语 硬件与GPU选择指南下载哪个文件如果你是本地生成新手不确定该下载什么文件可以根据你的显卡使用以下指南。⚠️关于VAEs的注意事项无论你的GPU如何每个人都必须下载/vae文件夹中的两个文件minimax_h3_audio_vae_fp32.safetensors和minimax_h3_video_vae_fp16.safetensors。1. 标准高端GPU16GB VRAM非常适合RTX 4070 Ti Super、RTX 4080等显卡。扩散模型下载INT4MiniMax_H3_[...]_pruned_int4_convrot.safetensors或混合精度_mixed_int4_int8_版本。文本编码器下载qwen3vl_32b_minimax_h3_int4_convrot.safetensors2. 发烧级GPU24GB VRAM非常适合RTX 3090、RTX 4090等显卡。扩散模型下载INT8MiniMax_H3_[...]_pruned_int8_convrot.safetensors以获得最高的剪枝质量。文本编码器下载qwen3vl_32b_minimax_h3_int8_convrot.safetensors3. 仅适用于Nvidia Blackwell GPU专门用于RTX 5090、PRO 6000和其他下一代Blackwell显卡。不要为30/40系列显卡下载这些文件扩散模型下载NVFP4MiniMax_H3_[...]_pruned_nvfp4.safetensors。文本编码器下载qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsFL2VA与Ref2VA有什么区别FL2VA如果你只想进行标准的文本到视频或简单的图像到视频使用一两个起始/结束图像请下载此版本。Ref2VA如果你想使用高级全参考多个图像、视频剪辑或音频输入请下载此版本。 包含的文件和格式该存储库使用统一的命名约定MiniMax_H3_FL2VA_*和MiniMax_H3_Ref2VA_*以便轻松集成到本地管道中。1. 扩散模型混合INT4/INT8混合精度模型。需要15GB以上显存约15.5 GB。MiniMax_H3_FL2VA_pruned_mixed_int4_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_mixed_int4_int8_convrot.safetensorsINT8最高质量的剪枝模型。需要24GB以上显存约21 GB。MiniMax_H3_FL2VA_pruned_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int8_convrot.safetensorsINT4适用于标准消费级硬件的高压缩模型约11.3 GB。MiniMax_H3_FL2VA_pruned_int4_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int4_convrot.safetensorsNVFP4实验性Nvidia 4位浮点模型需要Blackwell架构。MiniMax_H3_Ref2VA_pruned_nvfp4.safetensors12.5 GBMiniMax_H3_Ref2VA_nvfp4_mixed.safetensors24.4 GBMiniMax_H3_FL2VA_pruned_nvfp4.safetensors12.5 GB2. 文本编码器/text_encodersqwen3vl_32b_minimax_h3_int4_convrot.safetensors15.0 GB-推荐用于16GB GPUqwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1 GB-推荐用于24GB GPUqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7 GB-用于Blackwell GPU3. VAEs/vaeminimax_h3_audio_vae_fp32.safetensors605 MB - 音频解码器minimax_h3_video_vae_fp16.safetensors5.21 GB - 视频解码器️ 快速开始步骤1. 克隆仓库首先克隆项目仓库到本地git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot2. 根据GPU选择模型文件根据前面的硬件与GPU选择指南下载适合你显卡的扩散模型、文本编码器以及/vae文件夹中的两个文件。3. 集成到ComfyUI将下载的模型文件放置到ComfyUI的相应目录下即可开始使用MiniMax-H3-nvfp4-INT4-INT8-Convrot进行文本到视频的生成实验。 模型架构简介H3-Context-IRH3-Context-IR是一个托管的预处理和编排系统专为自由形式的多模态输入设计。它解释文本、图像、音频和参考视频之间的关系以及这些材料与预期生成输出的关系。H3-Context-IR将其对上下文的理解序列化为H3-Base接受的结构化表示。H3-BaseH3-Base使用相应的编码器或VAEs对不同的模态进行编码并将编码后的表示组织成统一的打包多模态序列。具体来说文本由H3-Encoder编码视觉输入由H3-Encoder和H3-VisualVAE共同编码音频仅由H3-AudioVAE编码。H3-Omni-Transformer联合预测视频和音频潜变量然后分别解码为视频和立体声音频。H3-EncoderH3-Encoder使用Qwen3-VL-32B的完整预训练权重并将其第50层的隐藏状态提供给H3-Omni-Transformer。H3-VAEH3-VisualVAE是一个时间因果视频自动编码器空间压缩因子为16×时间压缩因子为4×有24个潜通道f16t4d24。H3-AudioVAE对左右音频通道使用相同的编码器和解码器同时独立处理每个通道。它将32 kHz音频压缩成时间速率为40 Hz的潜令牌序列。H3-Omni-TransformerH3-Omni-Transformer是一个33B参数的密集单流Transformer。该模型使用三维多模态旋转位置嵌入MM-RoPE来表示时间和两个空间维度thw上的位置关系。 许可证与法律信息MiniMax H3及其量化衍生物根据MiniMax H3社区许可协议发布。使用官方API时用户提交的文本、图像和视频以及增强提示会受到自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。这些防护措施不影响被许可方在MiniMax H3社区许可下的义务特别是与合法使用和使用限制相关的义务。原始创建者/联系方式全球APIplatform.minimax.io联系方式modelminimax.io【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考