claude-video:给Claude装上”眼睛”,让AI自动分析任何视频

· 科技资讯

让大模型”看”视频,不再只是读字幕

7月27日GitHub Trending上冒出一个现象级项目:claude-video,日增+412星。它的功能直击痛点:下载任意视频→逐帧提取→自动转写→把所有信息打包喂给Claude,让AI能”看懂”视频内容

claude-video:给Claude装上

在此之前,大模型分析视频通常只靠两种方式:读字幕(丢掉了画面信息)或读截图(丢掉了时序信息)。claude-video把两者结合在了一起。

它是怎么工作的?

整个流程被封装成一个命令 `/watch`:

# 分析一个YouTube视频
claude-video /watch https://www.youtube.com/watch?v=xxxxx

背后发生了什么:

1. 下载:用yt-dlp下载视频文件

2. 抽取关键帧:按时间间隔抽取画面(默认每2秒一帧)

3. 转写音频:Whisper自动转写语音为文字

4. 打包上下文:把所有帧+时间戳+文字稿+元数据组织为一个结构化上下文

5. 交给Claude:把完整的上下文传给Claude进行分析

这样Claude得到的不再是一段文字描述,而是带时间轴的视频画面+对应时刻的语音内容

能做什么?

这款工具的实际应用场景非常丰富:

| 场景 | 用法 |

|——|——|

| 会议记录 | 录一段产品演示→AI自动提取功能要点、待办事项 |

| 教程学习 | 一小时的编程教程→AI提取关键步骤并生成文字版教程 |

| 竞品分析 | 竞争对手产品发布视频→AI自动整理功能对比表 |

| 内容审核 | 批量检查视频是否包含违规画面或语言 |

| 会议纪要 | Zoom录制→AI自动生成结构化会议纪要+行动项 |

安装和上手

前置依赖很简单:

# 安装claude-video
pip install claude-video

# 还需要yt-dlp和ffmpeg
pip install yt-dlp
sudo apt install ffmpeg

# 设置Anthropic API Key
export ANTHROPIC_API_KEY="your-key-here"

# 开始分析
claude-video /watch "https://youtube.com/watch?v=xxxxx"

项目地址:`bradautomates/claude-video`(Python)。

与同类方案的对比

Google Gemini视频分析:原生支持但需要上传到Google服务器,隐私和速度都不如本地方案

GPT-4V直接分析:只能分析少量截图,无法处理长视频的时序信息

手工处理:人工截图+人工听写+人工分析,一小时视频要花三四个小时处理

claude-video:本地处理+完整时序+自动转写+Claude深度分析,自动化程度最高

上手成本

– 小项目,文档简约但代码清晰

– 需要Anthropic API额度(分析长视频的token消耗不小)

– 依赖ffmpeg和yt-dlp,可能需要解决平台兼容性问题

– 视频下载速度取决于网络,长视频分析需要耐心

这个方向为什么会火?

视频是人类获取信息的主要方式,但AI理解视频一直是难题。 YouTube每分钟上传超过500小时的视频内容,企业每天产生海量的会议录制,在线教育平台积累了数以万计的课程视频——但这些内容对AI来说基本是”盲”的。claude-video的走红说明一个趋势正在加速:开发者正在用工程化手段弥补大模型”看不见”的短板,在大模型真正具备原生视频理解能力之前,这类”预处理+喂给AI”的中间件工具会越来越多,构成一个全新的工具生态层。

🔥 关注LC智趣厅,每天发掘改变工作方式的开源好物。

👇 你用AI分析过视频吗?体验如何?


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅