ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

FunASR 离线语音转写:一条命令部署加一条命令转写的本地完整实操指南

FunASR 离线语音转写:一条命令部署加一条命令转写的本地完整实操指南 FunASR 离线语音转写一条命令部署加一条命令转写的本地完整实操指南【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR客服录音质检、会议纪要、庭审与访谈转写这类音频往往不能离开内网合规要求数据不出域云端 API 按量计费且延迟不可控。FunASR 是达摩院开源的语音识别工具包一条部署脚本即可把 ASR 识别、VAD 端点检测、标点补全装进一个本地 WebSocket 服务音频进、文本出全程不经过任何云端接口。 FunASR 能力模块与适用边界模块解决什么问题本文路径ASR 识别Paraformer-Large 中文把音频转成文字整段离线识别精度最高✅ 核心路径VADFSMN-VAD语音端点检测判断哪段有人在说话切掉长音频里的静音段分段送识别✅ 服务端内置随流水线自动执行标点补全CT-Transformer给识别文本加逗号、句号输出可读段落✅ 服务端内置流式识别online / 2pass 模式边说边出字2pass 先流式出草稿再离线修正⭕ 客户端开关切换本文只演示 offline说话人分离、训练自训模型、热词 NN 模型多人会议分轨、领域微调、强召回❌ 超出本文范围见文末扩展材料适用场景内网闭环、数据合规敏感、文件级批量转写会议纪要、客服录音、庭审录音。 不适用需要 GPU 高吞吐推理、需要实时直播级低延时、需要训练自有领域模型的读者本文只覆盖 CPU 单机的最短落地路径。 部署前体检依赖清单操作系统LinuxUbuntu / CentOS / Debian脚本读取/etc/os-release自动适配Windows 走 Docker Desktop 并开启 WSL2 后端Docker缺失时一行安装FunASR 官方脚本curl -O https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/shell/install_docker.sh sudo bash install_docker.sh # 验证docker info 能输出系统信息即安装成功磁盘预留 ≥ 10GBDocker 镜像 ASR/VAD/标点三个模型 样例外网脚本需拉取镜像阿里云容器镜像仓库并下载模型机器必须可出网端口10095 空闲用ss -lntp | grep 10095确认无输出 一键部署离线转写服务第 1 步获取源码git clone https://gitcode.com/GitHub_Trending/fun/FunASR cd FunASR/runtime/deploy_tools成功标志当前目录能看到funasr-runtime-deploy-offline-cpu-zh.sh脚本文件。第 2 步安装并启动服务sudo bash funasr-runtime-deploy-offline-cpu-zh.sh install脚本按 6 个阶段执行拉取镜像列表 → 选择 ASR/VAD/标点模型 → 输入端口默认 10095直接回车→ 展示参数确认输入 Y→ 自动安装 Docker 并拉镜像 → 启动容器并下载样例。成功标志终端输出The service has been started.同时样例代码已解压到./funasr-runtime-resources/samples/。服务自检三条命令确认服务活着# 1. 查看当前全部配置端口、SSL、线程数 sudo bash funasr-runtime-deploy-offline-cpu-zh.sh show # 2. 确认容器处于 Up 状态 sudo docker ps | grep funasr_repo # 3. 探测 10095 端口服务端默认开 SSL 自签证书用 -k 跳过校验 curl -k -s -o /dev/null -w %{http_code}\n https://127.0.0.1:10095正常返回docker ps中 STATUS 列为Upcurl 打印出任意 HTTP 状态码如400或200即表示有进程在监听。返回000或提示Connection refused说明服务未起。️ 最小闭环完成一次真实转写输入样例部署脚本已下载一段示例音频asr_example.wav中文 16k 录音路径在仓库根目录下为runtime/deploy_tools/funasr-runtime-resources/samples/audio/asr_example.wav一条命令转写在仓库根目录执行# 先装客户端依赖仅需一次 pip install -r runtime/python/websocket/requirements_client.txt # 发起一次 offline 整段识别结果写入 ./out python runtime/python/websocket/funasr_wss_client.py \ --host 127.0.0.1 --port 10095 \ --mode offline \ --audio_in runtime/deploy_tools/funasr-runtime-resources/samples/audio/asr_example.wav \ --output_dir ./out终端实时输出样例识别文本随音频长度变化此处为示意connect to wss://127.0.0.1:10095 pid0_0: asr_example.wav: 你好这是一段用于测试离线语音识别的示例音频。 [MEETING 0_0] connection closed normally end看到pid0_0:开头的行即转写成功。产物文件位置路径内容./out/text.0_0每行一条结果音频名 \t 文本 \t 时间戳带时间戳的 tab 分隔文本./asr_logs/events.jsonl服务端每条消息与meta.json本次运行参数便于复现与验收不想敲命令的话用浏览器打开runtime/html5/static/index.html填入服务地址与端口 10095直接上传音频或点麦克风转写。️ 常用开关速查参数 / 开关作用何时用--audio_in wav.scp批量scp 文件每行标签 路径逐条转写一次转多个录音--mode online/--mode 2pass流式边说边出 / 先流式草稿再离线修正会议实时字幕、需要低延时出字非 wav 输入mp3、m4a客户端需 FFmpeg 解码apt-get install -y ffmpegWindows 用winget install ffmpeg--hotword file.txt热词文件每行词 权重如达摩院 20专有名词、术语、产品名易错时提升召回--use_itn 0关闭数字归一化ITN 会把一百二十三转成123希望保留原始读法时--ssl 0客户端走 ws:// 明文连接服务端已执行update --ssl 0--thread_num 4客户端多线程并行发送多个文件大批量时单线程吞吐不够update --asr_model 模型ID或本地路径服务端换 ASR 模型改完自动重启换行业领域模型update --decode_thread_num 8/--io_thread_num 2调服务端解码/IO 线程数压测发现并发不足update --host_port 10096换监听端口自动重启容器10095 被占用 排坑清单症状curl 返回000或Connection refused原因容器未启动或端口与--show显示的不一致解法sudo bash funasr-runtime-deploy-offline-cpu-zh.sh start再--show核对实际端口症状install卡在模型下载进度条不动原因机器无法访问模型源或镜像仓库网络策略拦截解法确认出网模型落盘在funasr-runtime-resources/models/可手动放好后重跑start症状转写 mp3/m4a 报错、解码失败原因客户端缺 FFmpeg无法解压缩格式解法apt-get install -y ffmpegWindows 用winget install ffmpeg后重跑症状提示 10095 端口被占用容器起不来原因本机已有服务占用默认端口解法update --host_port 10096脚本自动重启客户端--port 10096同步改症状客户端报 SSL 证书相关错误原因服务端默认使用自签证书解法示例客户端默认--ssl 1且跳过证书校验需明文时服务端update --ssl 0客户端加--ssl 0边界与延伸材料本文覆盖的是 CPU 单机、文件级离线转写的最短路径16k 中文录音、VAD 切分、离线识别、标点补全适合对数据出网敏感的内网业务闭环。若需要实时听写、说话人分离、时间戳精细对齐或训练领域模型请延伸阅读官方快速开始Python 版 WebSocket 服务端/客户端更多示例runtime/quick_start_zh.md离线服务部署进阶指南换模型、ITN、热词服务端配置runtime/docs/SDK_advanced_guide_offline_zh.md客户端完整参数与用法runtime/python/websocket/README.md【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表