ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Transformers语音识别:3行代码搞定录音转文字

Transformers语音识别:3行代码搞定录音转文字 Transformers语音识别3行代码搞定录音转文字【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers开会录音一小时的乱糟糟文件手工整理得大半天用 Transformers 的语音识别 pipeline3 行代码把音频转成带时间戳的文字GPU 上 10 秒的音频不到半秒就能出结果。先说句实话Transformers 本身没有声源分离这个任务多人同时抢话的录音靠它做不到一人一句的拆分。但单说话人的录音、需要逐句定位的转写场景它的automatic-speech-recognitionpipeline 非常能打。一句话讲清它一句话把音频丢给一个预训练好的识别模型吐出来就是文字还能给你每个词的时间戳。主流方案挑这几个就够whisper-base / whisper-small多语言、鲁棒日常转写首选whisper-large-v3准确率最高重要场合的逐字稿wav2vec2-base-960h体积小显存紧张时的轻量选择三分钟跑通语音转文字先装上依赖克隆仓库git clone https://gitcode.com/GitHub_Trending/tra/transformers cd transformers pip install transformers torch soundfile最小可运行代码不到 10 行from transformers import pipeline import soundfile as sf # Whisper 做语音识别一行加载 asr pipeline(automatic-speech-recognition, modelopenai/whisper-base) # 读入音频重采样到 16kHzWhisper 的输入要求 audio, _ sf.read(meeting.wav, samplerate16000) result asr(audio) print(result[text])跑一次大概半分钟主要时间花在下载模型上之后都有缓存。想系统了解训练细节可以看项目里的语音识别示例。效果有多快模型场景参考表现whisper-base英文 10 秒短句约 0.3 秒出结果WER 约 2%whisper-small中英混合会议长音频也能稳速度略降wav2vec2 XLSR微调单条数据集约 1 小时 20 分钟V100数字来自项目官方文档实际快慢取决于音频长短和你的硬件模型只加载一次后面全是推理越长越划算。把转写质量拉满三个参数最常用什么时候调哪个看场景# 长录音批处理 时间戳 result asr( audio, return_timestampsword, # 每个词都带上起止时间 batch_size16, # 分块批量推理长音频提速关键 chunk_length_s30, # 每块 30 秒送入模型 ) print(result[chunks])batch_size长音频会先被切成小块再逐块识别调大它就是批量送进模型速度明显上来chunk_length_s块太短会切断句子太长则吃显存30 秒是常见平衡点组合玩法30 秒一段自动切分逐段转写再合并适合没有 ffmpeg 的场景from transformers import pipeline import numpy as np import soundfile as sf asr pipeline(automatic-speech-recognition, modelopenai/whisper-small) audio, sr sf.read(long_meeting.wav, samplerate16000) sec 30 # 每段 30 秒 for i in range(0, len(audio), sec * sr): chunk audio[i : i sec * sr] text asr(chunk, batch_size8)[text].strip() if text: print(f[{i // sr:03d}s] {text})这几个坑先知道模型下不下来换个网络或设置代理后再跑一次模型下载完就存在本地缓存不会反复拉。识别出来全是外语Whisper 会自动猜语种中文环境偶尔猜错。传languagezh手动锁定误报率立刻降下来。长录音跑得特别慢加batch_size16和chunk_length_s30基本是最明显的提速手段。时间戳参数报错return_timestamps只有 Whisper 支持别的 seq2seq 模型会直接抛错CTC 模型则要用word或char字符串。最后说两句项目路线图上流式实时推理和小模型效率优化都在推进中长音频场景只会越来越顺。觉得有用的话收藏这篇有空可以翻翻 pipeline 官方文档也欢迎提 PR 一起把生态做厚。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表