ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

把两小时会议录音离线转成字幕:Buzz 本地 Whisper 转写实践笔记

把两小时会议录音离线转成字幕:Buzz 本地 Whisper 转写实践笔记 把两小时会议录音离线转成字幕Buzz 本地 Whisper 转写实践笔记【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz电脑里躺着一段两小时的会议录音你想拿到文字稿却不想把录音整个上传到云端——云端 API 按分钟计费内容还可能有不便外传的敏感信息。Buzz 就是干这个的一个在你自己电脑上离线运行 OpenAI Whisper 的桌面工具把音频转成文字、再翻译成目标语言全程不联网、不出机器。Buzz 到底是什么为什么要本地跑 WhisperBuzz 是什么它是一个 Python 桌面应用界面用 PyQt6 搭建核心引擎是 OpenAI 开源的语音识别模型 Whisper同时打包了 whisper.cpp、faster-whisper 等多个本地推理后端。跟云端转写服务或者裸跑 whisper 命令行相比它的差异点有三条完全本地音频文件不离开你的机器识别和翻译都在本机 GPU/CPU 上完成适合处理不便上传的录音多后端可切换同一个界面里可以用 PyTorch 版 whisperNvidia CUDA 加速、whisper.cppVulkan 加速核显也能跑、faster-whisper、Hugging Face 上的 Whisper 兼容模型甚至直连 OpenAI API 兜底图形界面和命令行双模式偶尔用一次就点鼠标要批量处理或写进脚本时用 CLI输出直接落到 SRT/VTT/TXT 文件。Buzz 离线转写最简安装步骤最短的路径是从 PyPI 装现成的包不需要自己编译源码。环境要求先列清楚Python 3.12项目锁死了版本3.10/3.11 装不上核心依赖系统里装有 ffmpeg负责解码音视频GPU 是可选项Nvidia 显卡走 CUDAApple Silicon 走 CoreML其他显卡可用 whisper.cpp 的 Vulkan# 需要 Python 3.12 环境且系统已装好 ffmpeg pip install buzz-captions buzz --version # 能打印出版本号就说明装好了Windows 用户也可以直接去官网下安装包装的时候 SmartScreen 会警告应用未签名选更多信息 → 仍要运行即可。拆五个核心能力看懂 Buzz 离线转写能干什么Buzz 内置了 5 种推理后端、支持 90 多种语言的识别能力大致可以拆成五个块按使用频率从高到低过一遍。本地转写文件变成字幕最常见的诉求丢进去一段录音或视频吐出来文字稿或字幕文件。命令行一条命令就能跑模型没下载过会自动先下载再转写# 用 whisper.cpp 的 small 模型转写同时输出 SRT 和 TXT buzz add --model-type whispercpp --model-size small \ --srt --txt ~/recordings/meeting.mp4注意两点默认tiny模型只是预览级精度正式稿建议至少small输出默认放在源文件同目录想换地方加--output-directory。转写查看器搜索、播放与时间轴修补转写第一稿几乎总需要人工细调Buzz 的转写查看器把这件事做成了一个带搜索框、可跟随播放、能调速的文本编辑器。点任意一行文本就会跳到对应时间点播放觉得哪句字幕时间戳飘了用时间轴调整工具resizer直接拖动起止时间即可调完重新导出 SRT 就是修好的字幕。坑在于调整只改本地数据记得重新导出否则旧字幕文件还是错的。音频翻译外语录音变目标语言文本不光要文字稿、还要中文稿的时候用translate任务而不是transcribe——它先转写成源语言再翻成目标语言# 把法语访谈翻译成中文-l 指定源语言可避免误判 buzz add --task translate --language fr \ --txt ~/recordings/interview.mp3要提醒的是翻译 转写 翻译两段计算耗时接近纯转写的两倍长音频建议先纯转写确认内容再决定翻不翻。实时转写与说话人分离开会、做演讲时需要实时字幕就点录音按钮从麦克风直接转还能开一个演示窗口——大字体的独立窗口投屏或挂第二块屏幕上给观众看。多人录音想分清谁说了什么转写时勾上说话人分离Buzz 会在识别前先做语音分离再逐段转写效果对背景嘈杂的录音提升明显。边界要说清楚实时转写是资源大户低配机器上实时要打个折扣说话人分离依赖音色差异两个人音色太接近时区分会糊。命令行与文件夹监视批量自动化文件多了不想点鼠标命令行一次丢进去一批也可以直接给一个 URLyt-dlp 会负责下载。配合--hide-gui可以完全无界面地跑在后台# 批量转写整个目录不弹主窗口 buzz add --hide-gui --srt --txt ~/audio/*.mp3另外 GUI 里有个文件夹监视功能指定一个目录新落进去的文件自动排队转写适合录完就扔进去的工作流。常见报错与一行排查命令前七天你会踩的问题基本集中在装不上、跑不动、结果不对三类这里按出现频率从高到低列出来。1.buzz: command not found现象pip 显示安装成功终端敲 buzz 没反应。 原因Python 环境不是 3.12或安装脚本的目录不在 PATH 里。 解法绕开 PATH 直接用模块入口启动python -m buzz2. Linux 上 GUI 起不来现象启动时报缺少libxkbcommon-x11-0、libportaudio2之类的库。 原因系统级的 GUI/音频库没装pip 包不带这些依赖。 解法sudo apt-get install libportaudio2 libxkbcommon-x11-0 ffmpeg完整依赖清单见 安装与系统依赖3. 转写慢得离谱现象十分钟的音频在 CPU 上跑了半小时还没完。 原因大模型在 CPU 上硬跑这是最典型的性能事故。 解法换 whisper.cpp 走 Vulkan或换小一档的模型buzz add --model-type whispercpp --model-size small --txt demo.mp34. 识别成乱码或错误语言现象英语录音被识别成波兰语满屏奇怪字符。 原因短音频或噪声大时自动语言检测容易翻车。 解法显式指定语言别依赖自动检测buzz add --language en --txt demo.mp35. openaiapi 报No OpenAI access token found现象选了 OpenAI API 后端一启动就报错退出。 原因API token 没有保存过。 解法命令行显式带上 tokenbuzz add --model-type openaiapi --openai-token 你的token demo.mp3性能与规模化音频变长后先选模型同一段十分钟的音频在同等硬件上 tiny 和 large 的耗时差距能到一个数量级所以选对模型和后端比任何调参都管用。before/after 的体感对比大致是这样beforelarge模型 纯 CPU十分钟音频要等几十分钟CPU 风扇狂转aftersmall模型 whisper.cpp 的 Vulkan 后端核显或独显都行几分钟内出稿精度对多数场景够用。具体怎么选看 模型选择界面 背后的设置逻辑Nvidia 显卡选 whisperCUDA核显/其他显卡选 whisper.cppVulkanApple Silicon 直接用系统加速。下面是两种典型档位# 快速预览tiny 模型精度最低但最快 buzz add --model-size tiny --txt ~/audio/demo.mp3 # 正式稿whisper.cpp 的 small 模型精度与速度平衡 buzz add --model-type whispercpp --model-size small --txt ~/audio/demo.mp3如果素材本身噪声大别一味堆大模型先勾上转写前语音分离extract speech往往更划算。延伸资源 下一步官方文档里最值得先读的两页CLI 参数参考add命令的完整选项表90 多种语言代码都在里面和 插件系统AI 摘要、自动字幕重排这些扩展是怎么挂上去的。读完本文你的下一步可以很简单挑一段自己最长的会议录音先用 tiny 模型跑一遍看流程通不通再换 small 出正式稿。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表