资讯动态

在Python中直接调用claude-real-video:process() API参考与自定义视频分析管线

发布时间:2026/10/8 18:55:57 来源:尧图企业网站定制
在Python中直接调用claude-real-videoprocess() API参考与自定义视频分析管线【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-videoclaude-real-video是一个 MIT 协议的开源 Python 工具让 Claude 或任何 LLM 真正看懂视频场景感知抽帧 去重 Whisper 字幕转录全部在你本机运行。本文面向 Python 开发者带你看清它的process()API 每个参数并教你用它搭出 4 类自定义视频分析管线 安装与三行代码的最短调用先装包推荐带 Whisper 转写能力并确认系统已装好ffmpegpip install claude-real-video[whisper]核心入口就一个函数——process()定义在 core.py#L1572-L1581并从init.py 直接导出from claude_real_video import process r process(lecture.mp4, out, langen, do_transcribeFalse) print(r.frame_count, r.transcript_path, r.manifest_path)传入视频 URLYouTube/Instagram 等或本地文件路径加上输出目录它会自动完成下载/复制 → 场景抽帧 → 滑动窗口去重 → 转录 → 写出MANIFEST.txt。命令行crv本身就是对它的薄封装见 cli.py#L154-L166。process() 参数速查表参数默认作用src/out_dir—视频 URL 或本地路径 / 输出目录scene0.30场景切换灵敏度越小抽帧越多fps_floor1.0密度保底每 N 秒至少 1 帧adaptiveFalse自适应抽帧捕捉缓慢渐变慢摇镜头、形变动画max_frames按时长自动帧数硬上限start/endNone只分析指定时间段支持90、1:30等写法dedup_threshold/dedup_window8/4去重像素变化阈值%/ 滑窗大小do_transcribeTrue设为False跳过音频转录whisper_modelbase转写模型tiny~large/turbokeep_audioFalse额外保存完整音轨audio.m4areportFalse保留被丢弃帧 生成可视化report.htmlwhyNone观看意图写入MANIFEST.txt引导分析speakersFalse说话人分离给每句打[SPEAKER_XX]标签frame_width640输出帧宽度小字多时调高四类自定义视频分析管线管线一纯关键帧提取最快零模型下载不想转录、只要哪些画面值得看do_transcribeFalse即可全程只用 ffmpeg Pillow无任何 ML 模型r process(clip.mp4, out, do_transcribeFalse) # 去重后剩下的帧都在 r.frames_dirout/frames/frame_001.jpg …此时它就是一个通用的视频关键帧提取器场景切换检测 去重适合做素材筛选、内容指纹。管线二录屏/小字内容的高清帧终端、表格、仪表盘这类意义在小字里的视频默认 640px 宽会丢掉细节。调高frame_width再交给多模态 LLMr process(demo.mp4, out, frame_width1600, do_transcribeFalse)抽帧逻辑不变只是每帧保留更多像素——代价是图片 token 成本上升按需调节。管线三慢变化内容用 adaptive 自适应抽帧2~3 秒的缓慢形变、渐进平移从不触发固定阈值默认模式会漏掉。adaptiveTrue改为拿每帧和它前 2 秒的滚动均值比较安静环境里的相对变化也能入选r process(animation-tutorial.mp4, out, adaptiveTrue)管线四只分析长视频里的一小段90 分钟会议里只关心 28:00–43:00 的录屏start/end会让 ffmpeg 直接 seek 而非解码全片帧预算和字幕也只落在窗口内而报告的时间戳仍是原片时间码方便你引用r process(meeting.mp4, out, start28:00, end43:00)用返回的 Result 接住整条管线process()返回 Result dataclass每个字段都是后续管线的抓手字段说明frame_count/extracted_frames去重后帧数 / 原始抽出帧数frames_dirframe_XXX.jpg所在目录frames_json_pathframes.json每帧的原片时间戳transcript_pathtranscript.txt及带时间戳的transcript.jsonmanifest_pathMANIFEST.txt给 LLM 读的分析说明书audio_pathkeep_audioTrue时的完整音轨frames.json让帧和字幕在同一个时间轴上对齐——你可以自己实现某句话说的时候画面是什么的问答逻辑或把它喂进视频 RAG 管线。MANIFEST.txt里已经写好了给模型的阅读指令含转录内容的信任边界标记把整个输出文件夹丢给 Claude/GPT 即可提问。测试文件 tests/test_smoke.py#L38-L67 演示了完整的端到端用法生成测试视频 →process()→ 校验frames.json时间戳严格递增是最好的参考范例。process() 内部如何做到场景感知了解管线原理有助于你调参详见 README.md 的 How it works 章节抽取——单次ffmpeg select遍历所有场景切换帧 每fps_floor秒保底一帧时间顺序天然保持extract_frames去重——三通道检测对比最近 N 帧滑窗全局像素差异通道、静定局部变化通道捕捉细笔画、字幕卡、小 UI 更新、动作通道捕捉占画面 1% 的小目标快速运动A-B-A 切回的镜头不会重复发送dedup_frames转录——视频自带字幕就直接用更快更准否则回退 Whisper清单——汇总为MANIFEST.txt帧时间戳全程随帧存活。所以模型拿到的是更少、更有信息量的帧——上下文更便宜理解更到位。常见问题process()需要联网吗处理全程在本地只有当src是 URL 时才会通过 yt-dlp 下载视频需要网络和 yt-dlp 已随包安装。输出目录非空会怎样process()默认拒绝向已有分析结果的目录写入防止两个视频混在一起重跑同参数请用overwriteTrue。ffmpeg 报错了帧抽取失败会直接抛RuntimeError并附上 ffmpeg 的原始报错先确认ffmpeg -version可用。更多实测数据与参数对比见 benchmark.md完整选项表见 README.md。【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑