让Claude看懂视频:claude-video给AI装上了眼睛

你在YouTube上看过一个很棒的教程,但想问Claude"他在第30秒做了什么"——Claude只能猜,因为它从来没法真正"看"视频。直到claude-video出现。

这个项目解决什么问题?

AI能读网页、能跑代码、能浏览仓库,但唯独看不了视频
你把一个YouTube链接丢给Claude,它只能根据标题猜内容,或者抓一个不完整的文字摘要——屏幕上发生的事,它一无所知。
claude-video用一行命令解决这个问题:

/watch https://youtu.be/<url> 他在30秒时做了什么?

Claude会下载、提取帧、抓取字幕,然后真正看到并听到这个视频,再回答你的问题。
日涨 988 stars,GitHub Trending 热度第一,MIT开源,零配置开箱即用。

核心亮点

1. 场景感知帧提取
不是每隔1秒截一帧,而是用ffmpeg场景变化检测,只在内容真正变化的时候提取帧。一个49分钟的屏幕录屏,它只需要100张帧就覆盖全程。
四种模式适应不同需求:

  • transcript:只抓字幕,0帧,4.5秒搞定
  • efficient:关键帧,50张,0.5秒提取
  • balanced:场景变化帧,100张,21秒
  • token-burner:不限量,全场景帧
    2. 智能字幕 + Whisper 兜底
    优先用yt-dlp抓原生字幕(免费、快速),没字幕时用 Whisper API 兜底。Groq 的whisper-large-v3被作为首选——更快更便宜。
    3. 帧去重机制
    屏幕录屏经常一帧停留90秒。claude-video 会自动检测近重复帧并跳过,避免同一个画面浪费 token。默认关闭可手动保留。
    4. 零配置安装
    macOS 首次运行时自动brew install ffmpeg yt-dlp,Linux/Windows 打印对应命令。Whisper API key 可选——有字幕的视频完全免费。

快速上手

# Claude Code(推荐)/plugin marketplaceaddbradautomates/claude-video /plugininstallwatch@claude-video# Codex / Cursor / Copilot / Gemini CLInpx skillsaddbradautomates/claude-video-g

安装后直接/watch <url> <问题>即可使用。

典型使用场景

  • 分析竞品内容:看别人怎么开场、怎么包装产品
  • 从视频里修bug:有人发屏幕录屏给你,你直接让Claude看
  • 加速学习:把一整个YouTube频道变成可搜索的笔记
  • 去hyping:发布视频里到底加了什么,去掉10分钟开场白

我的评价

claude-video 做对了一件事:它补上了AI能力拼图里最显眼的一块——视觉。
大多数AI编程工具都能处理文本和代码,但视频是一个巨大的盲区。这个项目用yt-dlp+ffmpeg+ Claude的Read工具,把视频变成了AI能消化的输入。
它的框架设计也很克制:不试图用AI识别画面内容(那是另外的模型),而是把每一帧当作图片让Claude自己看——这才是正确的抽象层级。
竞品对比:目前同类方案几乎都是基于专门的视觉模型(如 Video-LLaMA 等),但 claude-video 选择了一条更轻量的路——让已有的多模态大模型直接看截图。优势是无需额外部署模型,劣势是对画面内容的理解深度不如专门的视觉模型。
适用人群:经常需要和AI讨论视频内容的人、想要加速视频学习的人、做竞品分析的内容创作者。个人轻度使用也完全够。
一句话:如果你在用Claude Code或任何AI编程工具,/watch 应该在你的工具包里。