ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何用一条命令做多说话人语音识别:2小时会议录音变出谁说了什么的完整转录

如何用一条命令做多说话人语音识别:2小时会议录音变出谁说了什么的完整转录 如何用一条命令做多说话人语音识别2小时会议录音变出谁说了什么的完整转录【免费下载链接】whisper-diarizationAutomatic Speech Recognition with Speaker Diarization based on OpenAI Whisper项目地址: https://gitcode.com/GitHub_Trending/wh/whisper-diarization开完会只剩一堆录音文件想查谁在哪个时间点说了什么只能反复拖动进度条。Whisper Diarization 是一个开源说话人分离工具基于 OpenAI Whisper 做多说话人语音识别自动区分录音中每位说话人生成带时间戳的完整转录。一条命令跑起来带说话人标签的转录与 SRT 字幕环境要求Python 3.10 以上安装 FFmpeg 和 Cython获取代码git clone https://gitcode.com/GitHub_Trending/wh/whisper-diarization运行python diarize.py -a 你的音频文件结束后在音频同目录得到带说话人标签的转录和 SRT 字幕三段式流水线从 Whisper 语音转文字到说话人分离与时间戳对齐音频按顺序经过三道工序前一步的产出是后一步的输入语音转文字faster-whisper 把音频转成文本自动检测语言支持多语言识别说话人分离先从音频中剥离出人声轨提高嵌入精度再由 diarization/msdd/ 中的 MSDD 模型做 VAD 分段与说话人嵌入判断每段是谁说的时间戳对齐强制对齐为每个词标定起止时间再用标点恢复补偿微小时间偏移最后把说话人标签落到每一句上时间戳与说话人身份逐词绑定这正是它能做会议录音自动区分说话人的原因。 拿一段会议录音走完整流程从录音到文本和字幕以一段两小时的多人会议录音为例输入后运行一次命令会在音频同目录得到两个文件.txt 转录每段前带说话人标签形如 Speaker 1: 同一说话人的连续发言归入同一段可直接通读核对.srt 字幕标准 SRT 格式每条含序号、时间范围和说话人加文本可直接用于视频编辑与内容发布同样的流程换成客服中心通话录音可自动区分客服与客户的对话用于服务质量评估用于播客或访谈素材则得到带说话人标签的字幕方便内容检索与分发。真正影响效果的三个参数模型、批次与数字抑制--whisper-model默认 medium.en追求精度或非英语录音换更大的模型资源受限时换小的--batch-size默认 8显存不足时调低设为 0 可关闭批处理推理--suppress_numerals数字多且时间戳对不上时加上数字按发音文字转写提高对齐精度 遇到问题怎么办内存不足、识别错人、速度慢长音频内存不足 → 模型与批次占满显存 → 调低 --batch-size 或换更小的 --whisper-model说话人识别不准 → 背景噪音大或录音质量差 → 换干净的录音保留默认的声源分离人声剥离开关用 --no-stem 才关闭处理速度慢 → 两个模型串行执行 → 改用 diarize_parallel.py 并行跑结果与串行版一致需显存不低于 10GB目前为实验功能当前边界与主要入口文件重叠说话目前处理得有限标点恢复也只覆盖部分语言作者正在改进这两点与并行算法。参数与主流程在 diarize.py输出格式与标点恢复逻辑在 helpers.py。【免费下载链接】whisper-diarizationAutomatic Speech Recognition with Speaker Diarization based on OpenAI Whisper项目地址: https://gitcode.com/GitHub_Trending/wh/whisper-diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表