
MiniMind-O快速推理一条命令让0.1B小模型听懂语音并开口说话【免费下载链接】minimind-o️ A 0.1B Omni model trained from scratch, capable of listening, speaking, and seeing!项目地址: https://gitcode.com/gh_mirrors/mi/minimind-oMiniMind-O 是一个从 0 训练的约 0.1B 参数 Omni全模态模型它能听语音、看图片、读文本并把回答同时以文字和流式语音输出。最让人意外的是它的推理门槛——普通个人 GPU 即可训练CPU 也能快速推理而跑通语音对话只需要一条命令python eval_omni.py --load_from model --weight sft_omni这篇指南带你从零环境到出声全程 3 步 1 条命令。 MiniMind-O 能做什么MiniMind-O 把完整 Omni 链路压缩到 0.1B 量级核心能力包括听语音输入经冻结的 SenseVoice-Small 编码后进入模型看图像经 SigLIP2 编码支持图文语音混合提问说独立的 Talker 通过 MTP 一次预测多层 Mimi codes边生成边解码出24 kHz 流式语音无需等回答结束打断配合 VAD 支持 barge-in 实时打断与近似双工交互音色克隆换一段参考音频就能换音色内置 5 个音色 7 个 unseen 音色见 model/speaker/voices.pt。架构上它由 Thinker理解和 Talker语音生成两条路径组成代码入口在 model/model_omni.py。⚡ 三步准备环境作者参考配置i9-10980XE / 3090 / Ubuntu 20.04 / CUDA 12.2 / Python 3.10详见 README.md。没有 GPU 也能跑推理脚本会自动回退到 CPU。第 1 步克隆仓库git clone --depth 1 https://gitcode.com/gh_mirrors/mi/minimind-o cd minimind-o第 2 步安装依赖pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simplerequirements.txt 已固定 transformers、funasr、onnxruntime 等全部版本按文件安装最省心。第 3 步下载资源# 语音编码器 modelscope download --model gongjy/SenseVoiceSmall --local_dir ./model/SenseVoiceSmall # 视觉编码器 modelscope download --model gongjy/siglip2-base-p32-256-ve --local_dir ./model/siglip2-base-p32-256-ve # 音频编解码器 modelscope download --model gongjy/mimi --local_dir ./model/mimi # 说话人编码器音色克隆用 modelscope download --model gongjy/campplus --local_dir ./model/campplus # 发布权重关键 modelscope download --model gongjy/minimind-3o-pytorch --local_dir ./out完成后./model/下应有 4 个编码器目录./out/下有sft_omni768.pth权重。 一条命令开始语音推理在仓库根目录执行python eval_omni.py --load_from model --weight sft_omni模型加载后会自动跑通文本问答并生成回答音频保存为 mp3 到./output_audio/。想一口气体验全部模式文本 / 多轮 / 语音 / 音色克隆 / 图像 / 混合输入把--mode设为-1python eval_omni.py --load_from model --weight sft_omni --mode -1常用参数一览完整定义见 eval_omni.py参数默认说明--mode0-1all0text2audio4image5mix可用逗号组合--prompt_lang0问题语言0英文1中文2中英混合--temperature0.7Thinker 生成温度--device自动默认有 CUDA 用 CUDA否则 CPU--audio_dir./dataset/eval_omni/测试语音所在目录仓库自带 28 条中英文测试语音和 9 张测试图dataset/eval_omni/例如「为什么天空是蓝色的」「什么是黑洞」可直接用于试听模型表现。️ 试试实时语音 WebUI命令行之外MiniMind-O 还提供了两个更直观的推理入口# 实时语音通话推荐支持麦克风实时对话、barge-in 打断、音色克隆、电话模式 cd webui python web_demo.py服务默认监听 7860 端口浏览器打开http://localhost:7860即可前端页面在 webui/web_demo.html后端逻辑在 webui/web_demo.py。用户停止说话后Thinker 先完成 prefillTalker 随即逐帧产出音频 codeMimi 边收边写出 24 kHz 波形模型说话时你再开口系统会立即中断当前回答重新进入聆听。另外还有一个 Gradio 演示版适合上传音频/图片做非实时问答需先把 transformers 格式模型放入./scripts/目录用法见 README.mdcd scripts python web_demo_omni.py 看看推理效果下面是官方 A2A语音到语音样例真实语音问题 → 文本回答 → 流式语音回答。短句场景下中文回答连贯英文发音节奏相对稳定。图像问答链路I2A同样一条命令搞定用--mode 4即可。当前版本能抓住主体物体和大致场景 常见问题没有 GPU 能跑吗可以。--device默认在torch.cuda.is_available()为假时自动落到 CPU0.1B 规模 CPU 推理速度可接受只是实时性会打折扣。语音输出在哪--output_dir默认为./output_audio/每轮回答都会生成对应编号的 mp3。想换音色怎么办实时 WebUI 支持上传参考音频做 in-context 音色克隆无需改动任何权重。 下一步训练自己的权重仓库开源了 mini / full 两套数据mini 在单卡 3090 上约 2 小时跑通入口脚本 trainer/train_sft_omni.py一键流程见 trainer/train.sh读懂推理链路model.generate的流式实现与 Thinker–Talker 调度都在 model/model_omni.py从第一行代码读起完全可行更多细节架构、训练目标与 CER / 音色相似度评估见 README.md。从克隆仓库到听见它开口说话总共只需要 3 步 1 条命令——这就是 MiniMind-O 作为最小完整 Omni 基线的价值足够小、足够透明人人可以动手复现和改造。【免费下载链接】minimind-o️ A 0.1B Omni model trained from scratch, capable of listening, speaking, and seeing!项目地址: https://gitcode.com/gh_mirrors/mi/minimind-o创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考