
Remotion 视频检索10分钟给视频装上全文搜索【免费下载链接】remotion Make videos programmatically with React项目地址: https://gitcode.com/GitHub_Trending/re/remotion昨晚整理一场 90 分钟的分享录像我需要找到提到「内存泄漏」的位置来回拖进度条几乎看完全片。这次我用 Remotion 搭了一套视频检索语音识别、字幕索引、按时间跳转前后 10 分钟搜索不到 1 秒。前后对比一句话转写之后视频就变成一份可按关键词搜索的文本结果直接给你时间点。使用前使用后查找方式拖进度条靠耳朵输入关键词耗时515 分钟每支视频1 秒内出错率漏掉就漏掉了按识别结果逐条命中原理一行讲清把视频当成一本书。第一步是语音转文字相当于有人把书念出来记下来并记下每句话出现的时间第二步转成字幕把记录变成一份带页码的目录每条字幕有文字和起止时间第三步搜索就是翻这份目录。帧预览则是把那个时间点截一张图给你看点到为止链路就这三步。最小可运行路径整条路径 4 步核心 API 都在 packages/whisper-web/ 里。1. 装依赖跑npm install remotion/whisper-web remotion/captions装好两个包。2. 转写把 16kHz 单声道音频交给 transcribe()返回带逐词时间戳的 JSONimport {transcribe, downloadWhisperModel} from remotion/whisper-web; await downloadWhisperModel(small); const json await transcribe({ channelWaveform, // 16kHz 单声道 Float32Array取法见仓库文档 model: small, language: auto, });3. 转成字幕toCaptions() 把转写结果转成 Caption[]每条带 text、startMs、endMs这就是字幕索引的最小单元。4. 搜索搜索只是对一个数组做 filterimport {toCaptions} from remotion/whisper-web; const {captions} toCaptions({whisperWebOutput: json}); const hits captions.filter((c) c.text.includes(内存泄漏)); // hits 每条都能按 startMs 直接定位跳转跑通后你会看到什么输入关键词回来的是一个列表每条命中包含原句文字、起止时间以及按该时刻渲染一张 still 得到的帧预览。点一条播放器直接跳到那个位置。搜「内存泄漏」90 分钟里回了 3 处点第 2 条直接跳到 47 分 12 秒不用再拖条。适合谁用课程制作者学员问「哪段讲了 X」直接甩时间点字幕还能用 serializeSrt 序列化成 SRT 发给学员。企业内训把培训录像归档成可搜文本新人提问时先搜一遍会议录像再回答。媒体运营发布前跑一遍关键词扫描敏感词、口误、读错的名词全部定位出来。避坑与延伸⚠️ 三个真实会踩的坑模型体积与速度。模型越大识别越准但浏览器 WASM 转写明显更慢先用 small 跑通重要素材再换大模型复核。长视频别重复转。90 分钟的转写本身要几分钟跑一次存下来复用搜索本身是毫秒级过滤不构成负担。多语言配置。语言不确定就传 auto术语识别置信度低时用每条 caption 的 confidence 字段抽查核对。如果你已经接了 OpenAI 的 Whisper API可以看 packages/openai-whisper/里面有现成的转字幕函数SRT 的读写细节以 packages/captions/ 文档为准。三个模块拼起来本地视频的「目录」就做好了以后找片段先搜再拖。【免费下载链接】remotion Make videos programmatically with React项目地址: https://gitcode.com/GitHub_Trending/re/remotion创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考