claude-video:给Claude装上”眼睛”,让AI自动分析任何视频
让大模型”看”视频,不再只是读字幕
7月27日GitHub Trending上冒出一个现象级项目:claude-video,日增+412星。它的功能直击痛点:下载任意视频→逐帧提取→自动转写→把所有信息打包喂给Claude,让AI能”看懂”视频内容。
在此之前,大模型分析视频通常只靠两种方式:读字幕(丢掉了画面信息)或读截图(丢掉了时序信息)。claude-video把两者结合在了一起。
它是怎么工作的?
整个流程被封装成一个命令 `/watch`:
# 分析一个YouTube视频
claude-video /watch https://www.youtube.com/watch?v=xxxxx
背后发生了什么:
1. 下载:用yt-dlp下载视频文件
2. 抽取关键帧:按时间间隔抽取画面(默认每2秒一帧)
3. 转写音频:Whisper自动转写语音为文字
4. 打包上下文:把所有帧+时间戳+文字稿+元数据组织为一个结构化上下文
5. 交给Claude:把完整的上下文传给Claude进行分析
这样Claude得到的不再是一段文字描述,而是带时间轴的视频画面+对应时刻的语音内容。
能做什么?
这款工具的实际应用场景非常丰富:
| 场景 | 用法 |
|——|——|
| 会议记录 | 录一段产品演示→AI自动提取功能要点、待办事项 |
| 教程学习 | 一小时的编程教程→AI提取关键步骤并生成文字版教程 |
| 竞品分析 | 竞争对手产品发布视频→AI自动整理功能对比表 |
| 内容审核 | 批量检查视频是否包含违规画面或语言 |
| 会议纪要 | Zoom录制→AI自动生成结构化会议纪要+行动项 |
安装和上手
前置依赖很简单:
# 安装claude-video
pip install claude-video
# 还需要yt-dlp和ffmpeg
pip install yt-dlp
sudo apt install ffmpeg
# 设置Anthropic API Key
export ANTHROPIC_API_KEY="your-key-here"
# 开始分析
claude-video /watch "https://youtube.com/watch?v=xxxxx"
项目地址:`bradautomates/claude-video`(Python)。
与同类方案的对比
– Google Gemini视频分析:原生支持但需要上传到Google服务器,隐私和速度都不如本地方案
– GPT-4V直接分析:只能分析少量截图,无法处理长视频的时序信息
– 手工处理:人工截图+人工听写+人工分析,一小时视频要花三四个小时处理
– claude-video:本地处理+完整时序+自动转写+Claude深度分析,自动化程度最高
上手成本
– 小项目,文档简约但代码清晰
– 需要Anthropic API额度(分析长视频的token消耗不小)
– 依赖ffmpeg和yt-dlp,可能需要解决平台兼容性问题
– 视频下载速度取决于网络,长视频分析需要耐心
这个方向为什么会火?
视频是人类获取信息的主要方式,但AI理解视频一直是难题。 YouTube每分钟上传超过500小时的视频内容,企业每天产生海量的会议录制,在线教育平台积累了数以万计的课程视频——但这些内容对AI来说基本是”盲”的。claude-video的走红说明一个趋势正在加速:开发者正在用工程化手段弥补大模型”看不见”的短板,在大模型真正具备原生视频理解能力之前,这类”预处理+喂给AI”的中间件工具会越来越多,构成一个全新的工具生态层。
🔥 关注LC智趣厅,每天发掘改变工作方式的开源好物。
👇 你用AI分析过视频吗?体验如何?
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn