ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz 实战指南:免费离线转录,把本地语音转成文字和字幕

Buzz 实战指南:免费离线转录,把本地语音转成文字和字幕 Buzz 实战指南免费离线转录把本地语音转成文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线转录与音频翻译桌面应用。它基于 OpenAI 的 Whisper 模型在你自己的电脑上运行音频全程本地处理、不上传云端适合需要把会议录音、视频内容、讲座音频变成文字和字幕的人。这几个痛点Buzz 恰好能解录音涉及敏感内容不想交给云端。大多数在线转写服务要求你把音频上传到服务器。Buzz 的转录和翻译全部在本地机器上完成音频文件不出你的电脑。按分钟计费的转写服务量大就贵。Buzz 免费、不限时长、不限次数转一天讲座和一个 30 秒的语音条成本一样零。做字幕要串好几款工具。抽音轨、转写、对时间戳、导出 SRT传统流程每步都得换工具。Buzz 在一个窗口里走完整个流程视频文件直接丢进去就能出字幕文件。现场活动时字要立刻能看。开会、讲座、访谈时你可以边录边出字还能打开演示窗口把实时文字投到大屏上。机器配置一般不知道该用哪个模型。它内置 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 四类后端从只有核显的笔记本到带显卡的台式机都能跑选错后端也不会卡死。装起来安装包、PyPI 与命令行三条路图形界面下载安装包装完就能用macOS 用户下载 .dmg 安装包注意现在仅支持 Apple 芯片机型Windows 用户下载对应的安装文件Linux 用户直接一条命令装 Flatpak 版flatpak install flathub io.github.chidiwilliams.Buzz完成信号启动后看到主窗口中间是一张任务表包含文件、模型、任务、状态四列。导入一个文件后这一行会出现在表里状态列显示 Queued。从 PyPI 安装两条命令跑起本地转录这条路径适合开发者。前提是系统里已装好 ffmpeg并且使用 Python 3.12 环境pip install buzz-captions python -m buzz完成信号python -m buzz弹出和安装包版本相同的主窗口或者终端运行buzz --version能打印出版本号。提示PyPI 装出来的是 CPU 版 PyTorchNvidia 显卡用户想要 GPU 加速需要按 README 中文说明 另行安装 CUDA 版 torch具体见后文常见问题。命令行一条 buzz add 直接出字幕装好之后PyPI 方式会自动带上 CLI不打开界面也能干活buzz add -m whispercpp -s medium -l zh --srt meeting.mp3这条命令的含义用 Whisper.cpp 后端的 medium 模型按中文转写meeting.mp3结果输出为 SRT 文件。想同时要 VTT 就加--vtt想只出纯文本就换成--txt。还支持一次传多个文件或把整个目录打包处理buzz add --srt --output-directory ./subtitles recordings/*.mp4完整参数含 90 多种语言代码、初始提示词、单词级时间戳等都在 CLI 参数文档 里。完成信号源文件同目录下多出了一个同名的 .srt 文件输出目录默认为输入文件所在目录用文本编辑器打开能看到带序号和时间轴的字幕条目。实战场景从视频字幕到会议实录场景一把视频音轨变成 SRT 字幕目标拿到一份能直接拖进剪辑软件的字幕文件。在主窗口用工具栏的加号按钮导入视频文件Buzz 会自动抽取音轨你不需要自己转格式。选中任务行把任务设为 Transcribe语言填中文模型按机器性能选 small 或 medium点运行。转写完双击任务打开转录查看器底部有播放条点击某一行就能跳到对应时间点边听边核对文字。在顶部 Export 菜单导出 SRT 或 VTT。产出一个带精确时间戳的字幕文件。安静环境下 small 模型准确率就够用环境嘈杂或语速快升到 medium 再跑一遍更稳。场景二会议实时录音边说边出字 ️目标开会时同步产出带时间戳的文字记录。点工具栏的麦克风按钮切到实时录音模式。依次选择任务Transcribe、语言、模型和麦克风。这里建议用 Whisper.cpp 后端加 small 甚至 base 模型因为默认 Whisper 后端对资源消耗很大实时跑会拖慢队列。点 Record 开始下方面板随语音滚动出文字。需要投屏时点录音中出现的 Presentation window 选项打开独立演示窗口把实时文字放大展示。结束录音后保存如果是多人发言还可以对结果做说话人识别把谁说了什么标注清楚。产出一份带时间戳的会议文字稿可导出 TXT 或 SRT之后还能翻译成其他语言归档翻译功能需要配置一个支持 OpenAI API 的接口见 翻译文档。实时模式下追加并纠正模式可通过调整转录步长在延迟和负载之间取舍详见 实时录音文档。场景三批量转录整个文件夹 目标几十个录音文件不点鼠标自动处理完。打开 Preferences 的 Folder Watch 选项卡指定一个监视目录。之后任何新的音频文件落进这个目录Buzz 会自动建任务并开始转录。如果你更喜欢脚本而不是守着 GUI用前面提到的buzz add --srt --output-directory ./subtitles recordings/*.mp4一条命令处理整个目录写进 shell 脚本或 CI 任务里即可。产出输出目录里与源文件一一对应的字幕或文本文件。注意批量任务按顺序排队执行机器性能有限时把模型调小整批跑完的时间会明显缩短。常见问题转录速度太慢卡在哪了原因通常是模型对当前机器偏大或者后端没吃到 GPU。⚡ 先降模型档位tiny 或 base 比 large 快一个量级精度损失在多数场景可接受。再换后端Whisper.cpp 支持 CUDA 和 Vulkan 加速Nvidia 显卡、其他品牌显卡、甚至只有核显的机器都能利用上。Windows 官方安装包自带 CUDA 12 运行时Nvidia 显卡开箱即用。Windows 安装时弹出安全警告要紧吗不要紧。原因是安装包没有做代码签名Windows 对未签名程序一律先警告。点更多信息再选仍要运行即可这是预期行为和中毒无关。专有名词和术语老是认错原因是模型缺少领域上下文或者语言自动检测判错了。两个办法配合使用一是在高级设置里填初始提示词CLI 对应-p参数把常出现的术语、人名写进去模型会优先按这些词来听二是语言已知的情况下手动指定别用自动检测检测本身有概率出错。PyPI 装的版本 GPU 不生效原因是 pip 默认装的是 CPU 版 torch。Windows 上按 README 说明改装 CUDA 版 torch 和对应 cu12 运行库README 里给了现成的安装命令Linux 上 Nvidia 显卡开箱即用如果仍有问题检查 CUDA、cuBLAS、cuDNN 是否装齐。完全断网的电脑也能转录吗能。前提是在有网的机器上先把模型下载好然后整份拷贝到离线机器的同一位置Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。在帮助 → 偏好设置 → 模型里下载过一个模型后点 Show file location 就能找到这个目录仓库里也有 scripts/download-models.py 脚本帮你提前备好离线模型缓存。二次开发从这两个目录入手想接新后端看 buzz/transcriber/Whisper、Whisper.cpp、Faster Whisper 各占一个文件抽象层很薄想加插件看 buzz/plugins/AI 摘要、DOCX 导出、字幕时长自动调整等内置插件都长在那里照着 base.py 的接口写即可。继续往下走更完整的操作细节在 官方文档 里按场景分篇写得比较细遇到具体功能可以先去那边翻。发现 bug 或有改进想法直接到项目 Issues 页面提交维护者的响应频率很高。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表