AutoSub 安装教程:3 种方式(pip/GPU/Docker)快速搭建视频字幕生成环境
AutoSub 安装教程:3 种方式(pip/GPU/Docker)快速搭建视频字幕生成环境
【免费下载链接】AutoSubA CLI script to generate subtitle files (SRT/VTT/TXT) for any video using either DeepSpeech or Coqui项目地址: https://gitcode.com/gh_mirrors/auto/AutoSub
AutoSub 是一款开源的视频字幕自动生成工具,只需一条命令就能为任意视频生成 SRT、VTT、TXT 三种格式的字幕文件,底层基于 Coqui STT / DeepSpeech 语音识别引擎。本文是一份面向新手的 AutoSub 安装教程,带你用 pip 安装、GPU 加速安装、Docker 部署三种方式,快速搭建自己的视频字幕生成环境,从此告别手动打轴,效率翻倍。😎
一、AutoSub 是什么?先了解字幕生成原理
AutoSub 是一个基于 Python 的命令行(CLI)工具,它把"视频 → 字幕"的复杂流程自动化,整个工作链路如下:
- 🎬提取音频:调用 FFmpeg 从视频中抽取 16kHz 采样率的音频
- ✂️静音切分:利用 pyAudioAnalysis 的静音检测算法,把长音频切成多个小片段,方便推理
- 🧠语音识别:对每个片段运行 Coqui STT / DeepSpeech 模型推理
- 📝写出字幕:汇总时间戳,自动生成 SRT / VTT / TXT 文件到
output/目录
想深入了解实现细节,可以查看这些核心模块:autosub/main.py(主程序与参数解析)、autosub/audioProcessing.py(音频提取)、autosub/segmentAudio.py(静音切分)、autosub/writeToFile.py(字幕写出)以及autosub/utils.py(工具函数)。安装配置在setup.py与Dockerfile中,依赖清单见requirements.txt(CPU)与requirements-gpu.txt(GPU)。
二、安装前准备:环境要求与依赖清单
无论选择哪种安装方式,都需要先确认环境满足以下条件:
| 项目 | 要求 |
|---|---|
| Python | 3.x(建议 3.10 及以下版本) |
| FFmpeg | 4.x(用于音频提取) |
| 模型文件 | Coqui 的.tflite模型 +.scorer评分器 |
| 显卡(可选) | NVIDIA GPU 且 CUDA 版本匹配 |
💡依赖清单区别:CPU 安装使用requirements.txt,GPU 安装则换成requirements-gpu.txt——后者额外包含tensorflow-gpu==1.15和deepspeech-gpu==0.9.3,能让推理跑在显卡上,速度大幅提升。
三、方式一:pip 安装(CPU,最快上手)
这是最推荐的入门方案,一共 5 步,全程 5 分钟搞定。
第 1 步:克隆仓库并进入目录
git clone https://gitcode.com/gh_mirrors/auto/AutoSub cd AutoSub第 2 步:创建虚拟环境(强烈建议)
为避免依赖冲突,推荐用 virtualenv 隔离环境:
python3 -m pip install --user virtualenv virtualenv -p python3 sub source sub/bin/activate第 3 步:pip 安装依赖与程序
pip install .安装完成后会自动注册autosub命令(见setup.py中的 console_scripts 配置),方便后续直接调用。
第 4 步:安装 FFmpeg
Ubuntu / Debian 系统执行:
sudo apt-get install ffmpeg ffmpeg -version第 5 步:下载语音模型
模型文件需放在仓库根目录。执行getmodels.sh即可自动下载 Coqui 模型与评分器(版本号作为参数):
./getmodels.sh 0.9.3✅ 安装完成后运行autosub --dry-run验证环境是否就绪。
四、方式二:GPU 加速安装(NVIDIA 显卡用户的进阶之选)
如果你有 NVIDIA 显卡,推荐走 GPU 路线——同样的视频,识别速度可能快出数倍。😍
安装 GPU 版依赖
先安装 GPU 依赖清单,再安装程序本体:
pip install -r requirements-gpu.txt pip install .⚠️重点注意 CUDA 版本匹配:requirements-gpu.txt锁定的是tensorflow-gpu==1.15与deepspeech-gpu==0.9.3,请确保本机 CUDA 版本与之兼容,否则推理时会报 CUDA 初始化错误。
验证 GPU 是否被识别
运行一次--dry-run可提前实例化 CUDA / TensorFlow 缓存,避免正式执行时卡在加载阶段:
autosub --dry-run之后正常使用autosub --file 视频路径即可,其余操作与 CPU 版完全一致。
五、方式三:Docker 部署(免配置环境,开箱即用)
不想折腾 Python 环境?Docker 把依赖、FFmpeg、模型全部打包进镜像,一条命令启动。👍
CPU 版 Docker
# 1. 先准备好模型文件 ./getmodels.sh 0.9.3 # 2. 构建镜像 docker build -t autosub . # 3. 运行(视频放在 input/ 目录) docker run --volume=`pwd`/input:/input --name autosub autosub --file /input/video.mp4 # 4. 取出生成的字幕 docker cp autosub:/output/ .GPU 版 Docker
通过--build-arg指定 GPU 基础镜像和 GPU 依赖清单:
docker build --build-arg BASEIMAGE=nvidia/cuda:10.1-cudnn7-runtime-ubuntu18.04 \ --build-arg DEPSLIST=requirements-gpu.txt -t autosub-base . docker run --gpus all --name autosub-base autosub-base --dry-run docker commit --change 'CMD []' autosub-base autosub-instance docker run --volume=`pwd`/input:/input --name autosub autosub-instance --file /input/video.mp4 docker cp autosub:/output/ .📌 GPU 版先把程序实例"固化"成可复用镜像(
autosub-instance),下次运行就能跳过模型加载耗时,非常适合批量处理视频。
六、安装后第一步:生成你的第一个字幕文件
安装完成后,最基础的使用方式:
python3 autosub/main.py --file ~/movie.mp4脚本运行结束后,字幕文件会自动保存到output/目录,直接拖进 VLC 播放器即可加载。常用参数也一并送给你:
| 参数 | 作用 | 示例 |
|---|---|---|
--split-duration | 单条字幕最大显示秒数(默认 5 秒) | --split-duration 8 |
--format | 只输出指定格式(srt/vtt/txt) | --format srt txt |
--model/--scorer | 指定自定义模型文件 | --model my.tflite |
--dry-run | 预检参数、初始化缓存 | --dry-run |
七、常见问题与排错建议(FAQ)🔧
- 模型文件缺失怎么办?脚本会自动下载默认模型;多版本并存时可用
--model与--scorer指定。 - 只支持英文吗?默认是英文模型,处理其他语言需手动下载对应语言的模型与评分器。
- 生成速度大概多快?官方在双核 i5 + 8GB 内存的笔记本上测试,70 分钟视频约需 40 分钟,通常不超过视频时长的 60%;GPU 环境下会明显更快。
- CUDA 报错怎么排查?优先检查 CUDA 驱动版本是否与
requirements-gpu.txt中的依赖匹配,可先跑--dry-run验证。
结语
至此,你已经掌握了 AutoSub 的三种安装方式:pip 安装适合快速体验,GPU 安装适合追求速度,Docker 部署适合省心迁移。选择最适合你的一种,把"等字幕"变成"生成字幕",让视频处理更高效吧!🚀
【免费下载链接】AutoSubA CLI script to generate subtitle files (SRT/VTT/TXT) for any video using either DeepSpeech or Coqui项目地址: https://gitcode.com/gh_mirrors/auto/AutoSub
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考