
播客和采访终于不乱了claude-real-video --speakers 本地说话人分离完全指南【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-videoclaude-real-video命令名crv是一个完全本地运行的开源视频分析工具它把视频转成 LLM 真正看得懂的关键帧 带时间戳的文字稿。而--speakers参数则是为播客、采访、会议录播量身定制的本地说话人分离功能——每一行台词前都会自动标上[SPEAKER_00]、[SPEAKER_01]让 AI 从此分清谁说了什么。痛点AI 看播客和采访为什么总是张冠李戴大多数人把访谈视频丢给 AI 时它实际读到的只是一份纯文字转写稿。问题来了两个人来回问答AI 分不清谁在提问、谁在回答总结时容易把观点安错人嘉宾和主持人的观点被混在一起产出的摘要、要点清单自然乱想追问这位嘉宾在第几分钟表达了什么立场——没有时间戳和说话人标签AI 只能猜。crv的--speakers正是解决这件事转写完成后它会在你的机器上运行一个离线说话人分离模型45 MB只下载一次不需要任何账号和 token给每段台词打上说话人标签。一键安装claude-real-video speakers 依赖怎么装--speakers依赖 sherpa-onnx 这套离线模型需要额外安装一个可选依赖pip install claude-real-video[whisper][speakers][whisper]负责语音转写文字稿的来源[speakers]安装sherpa-onnx和numpy负责本地说话人分离。 系统还需要ffmpegmacOS 用brew install ffmpegLinux 用apt install ffmpeg这是所有视频功能的基础。安装完成后首次运行会自动把两个小模型下载到~/.cache/claude-real-video/speaker-models/之后离线可用。相关下载与校验逻辑都在 speakers.py。运行 --speakers一条命令搞定播客说话人分离装好后用法就是普通的crv命令加一个--speakerscrv 你的播客或采访视频链接 --speakers本地文件同样适用crv interview.mp4 --speakers它会依次完成场景感知抽帧 → 去重 → 语音转写 →说话人分离并给台词打标。整个过程都在本机完成源视频不会上传到任何地方。输出长什么样transcript 里多了说话人标签带--speakers运行后输出目录里最重要的变化是文字稿transcript.txt每行一句话行首带[SPEAKER_00]、[SPEAKER_01]这类前缀transcript.json每个 segment 多出一个speaker字段方便程序化处理MANIFEST.txt给模型看的说明书会自动写明检测到 N 位说话人台词已打标签AI 读到这份清单就知道该按说话人理解内容了。打标逻辑很直白对每段台词找出与之时间重叠最多的那段说话人回合作为归属实在没有重叠的会在 2 秒容差内找最近的说话人。这部分实现见 core.py 中的 _label_transcript_speakers 和 speakers.py 中的 assign_speakers。场景典型效果双人播客 / 一对一采访主持人与嘉宾的问答清晰分开多人会议录播自动区分多位发言人无需告诉它几个人单人演讲只有SPEAKER_00不产生噪音无音轨 / 无文字稿的视频自动跳过并在 MANIFEST 中说明原因不报错常见问题排查报错说需要 speakers 依赖说明只装了核心包补跑一遍pip install claude-real-video[speakers]即可依赖检查逻辑在 core.py。首次运行卡在下载两个模型合计约 45 MB带进度条显示只下载一次若下载中断重新运行会续上或手动清理~/.cache/claude-real-video/speaker-models/后重试。说话人分多了或分少了分离阈值已针对常见多人场景校准见 diarize 的参数说明。日常播客和采访直接用默认值即可如需精细调整可以直接用 Python 调用diarize()函数传参。进阶让 AI 带着目的分析你的播客--speakers可以和这些参数自由组合适合播客/采访工作流参数用法作用--why--why 整理嘉宾关于定价的观点告诉 AI 你的关注点摘要更聚焦--from/--to--from 28:00 --to 43:00只分析长视频里的一段时间戳仍是原视频时间--kb--kb ~/notes把结果存成带日期的笔记进你的知识库--viewer同上加--viewer生成本地网页一边看视频一边对照标签文字稿例如一条组合命令crv podcast-ep42.mp4 --speakers --why 整理嘉宾观点 --kb ~/notes全部参数说明可参考 cli.py 中的参数定义更完整的功能文档见 SKILL.md。小结回到标题里的问题播客和采访的 AI 笔记乱根源是文字稿缺了谁说的这一维。claude-real-video的--speakers用一条命令、一个 45 MB 的本地模型把说话人分离补上了——零账号、零上传、零额外成本AI 的输出从此有据可依。安装pip install claude-real-video[whisper][speakers]运行crv 视频 --speakers收获带[SPEAKER_XX]标签的文字稿 场景关键帧全部留在本机【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考