ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz 离线语音转写完整指南:三步把本地录音变成文字稿

Buzz 离线语音转写完整指南:三步把本地录音变成文字稿 Buzz 离线语音转写完整指南三步把本地录音变成文字稿【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz你手里有一段两小时的会议录音想要的只是一份能直接编辑、能导出的文字稿又不想把文件上传到云端。Buzz 就是干这个的一款免费开源的桌面应用用 OpenAI Whisper 模型在你自己的电脑上完成离线转录和翻译数据全程不出本机Windows、macOS、Linux 三个平台都能装。 从装好到出第一个结果装好软件、导入一个文件、双击出结果一共三步。第一步安装。按你的系统挑一种Windows / macOS下载对应的安装包直接运行。Windows 程序没有数字签名安装时弹出警告选More info→Run anyway即可。LinuxFlatpak 或 Snap 任选其一。习惯命令行的 Python 用户需要 Python 3.12 和 ffmpegpip install buzz-captions python -m buzz# Linux 两条命令装好 flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz第二步导入文件并启动转录。打开 Buzz 后点工具栏的图标或 File 菜单的Import Media File快捷键 Ctrl/CmdO选中音频或视频文件——MP3、WAV、M4A、FLAC、MP4、MKV 这类常见格式都认也接受一个 YouTube 链接。接着在任务栏里定三件事任务是Transcribe转录原文还是Translate to English翻成英文、语言选哪种知道的话直接指定比自动检测更准、模型选多大新手选small速度和准确性比较平衡最后点Run。第三步查看并导出。任务列表里状态变成Completed后双击那一行就进入转录查看界面逐句的时间戳、文本配上音频播放器。点导出按钮可以存成 TXT、SRT、VTT 三种格式。到这里本地离线转录的最小闭环就走完了。 先搞懂这三个核心能力三个能力覆盖绝大多数使用场景先知道它们能干什么、从哪进去。1. 文件批量转录——处理手头现成的录音。这是 Buzz 的基本盘。除了单个文件它可以一次导入多个文件排队处理更省事的是监控文件夹在偏好设置里指定一个目录之后丢进去的新音频会被自动转录不用每次手动点。适合访谈录音、课程录像这种会持续产出的素材。入口在 File 菜单和偏好设置的Folder Watch标签。2. 麦克风实时转录——会议和讲座边说边出字。选好转录任务、语言和麦克风点Record就开始。说话内容实时变成文字新句子追加在下方。它有个Presentation window录音开始后会出现这个按钮点开就是一个大字体的全屏窗口放在会议室大屏上给所有人看。官方提醒过默认 Whisper 模型做实时转录比较吃资源想跟得上语速建议用 Whisper.cpp 后端加小一点模型。入口在主界面顶部的 Live Recording 模式切换。3. 转录查看器——改字、对齐、重排字幕。双击任一任务进入的编辑界面比看结果功能多不少Ctrl/CmdF全文搜索播放器可 0.5x 到 2.0x 变速勾选Follow Audio文字会跟着播放进度自动滚动Ctrl←/→能按 0.5 秒微调每句的起止时间。最实用的是Resize按钮如果你导入时勾了Word-Level Timings词级时间戳就能按最大字幕长度重新合并断句、按标点切分还能统一延长每条字幕的停留时长——做视频字幕时这一步基本必备。多人对话的场景里Identify speakers按钮会把不同说话人的句子自动标上标签你可以试听 10 秒样本、把标签改成真名。 可以这样用在你手里给播客或网课配字幕。导入视频文件模型选small或更大一档导入选项里勾上Word-Level Timings转录完成后进查看器点Resize把字幕长度和切分方式调顺导出 SRT 丢进剪辑软件。全程不用打开任何在线字幕工具。跨国会议记录。开启 Live Recording语言选会议实际使用的语言如果参会的人里有一两个专业词总被拼错在Advanced...的Initial prompt里把人名、术语写进去识别准确率会明显好转。录完导出 TXT直接进整理流程。攒一批文件交给它自动干。两个办法一是配好监控文件夹素材丢进去就出文字稿二是用命令行。Buzz 自带 CLI比如这条会用 Whisper.cpp 的 small 模型转录一个 MP4 并同时产出 SRT 和 VTT 字幕buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt /path/to/录像.mp4CLI 的完整参数列表见 docs/docs/cli.md脚本化批处理时可以当手册用。⚙️ 开始之前要知道的事几个高频问题先看清楚能省不少调试时间。转得太慢先试这三样。换更小的模型medium换small后端换成 Whisper.cpp它是 C 实现核显和纯 CPU 机器上都能跑也是 Mac 上的推荐项有 NVIDIA 显卡且显存 6GB 以上的话用 Faster Whisper比标准 Whisper 快一个量级。模型怎么选官方 FAQ 的说法small 快但错得多large 准但慢。Large-V3多数情况下最准但偶尔会脑补出音频里没有的词重要内容值得两个模型都跑一遍对比。完全没网的电脑也能用。在有网机器上把模型下下来从Help → Preferences → Models点Show file location找到模型目录整份拷到离线机器的同一位置就行。Linux 上是~/.cache/Buzz。几个小坑提前说。很老的 CPU不支持 AVX2跑不起来 Buzz录音报错PaErrorCode-9999一般是系统麦克风权限没给Windows 去设置里的隐私选项里开Windows 安装包提示未签名是正常现象照提示点Run anyway。想翻译成中文、西班牙语这类目标语言内置的翻译任务只翻到英文翻到任意其他语言要配置一个 OpenAI 兼容的 API 密钥ChatGPT、Claude 或本地 Ollama 都行官方估过成本一小时音频的翻译大约 1 美元。另外Translate to English这个任务与Large-V3-Turbo模型不兼容遇到这种情况换用 AI 翻译入口。 适合谁不适合谁适合这几类人在意隐私、不想把会议录音和内部资料传上云的做字幕、播客整理、访谈转录这类固定工作的以及想把转录嵌进脚本和自动化的CLI 监控文件夹 插件系统插件机制在 plugins/ 里自带 AI 摘要、自动字幕重排等现成插件。不适合的部分也要说清楚实时转录对配置有要求低端机器上跟不上语速属正常现象说话人识别在 Intel 版 macOS 上不可用核心转录是离线免费的但多语言 AI 翻译依赖外部 API不是纯本地。Buzz 的代码和文档都放在仓库里想深入可以看 docs/ 的使用章节和 buzz/transcriber/ 的转录核心模块。如果你这周就有要处理的录音现在就可以动手Windows 和 macOS 用户下载对应安装包Linux 用户跑一行flatpak install flathub io.github.chidiwilliams.Buzz装完导入文件、点Run几分钟后你就能拿到第一份离线生成的文字稿。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表