ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VoiceMem模型家族与ChatMem-400K数据集:三阶段OPD训练流程深度解读

VoiceMem模型家族与ChatMem-400K数据集:三阶段OPD训练流程深度解读 VoiceMem模型家族与ChatMem-400K数据集三阶段OPD训练流程深度解读【免费下载链接】VoiceMemInfrastructure for the next generation of voice agents, designed to provide universal memory. It is divided into a left brain and a right brain, storing information and emotions respectively, while a fully streaming architecture eliminates latency at the fundamental level.项目地址: https://gitcode.com/gh_mirrors/vo/VoiceMemVoiceMem是一个面向实时语音智能体的开源记忆系统它用「流式双脑」架构让语音模型真正拥有长期记忆左脑负责存储事实信息右脑负责管理情绪与人格整条链路全程流式处理几乎不增加延迟。除记忆系统本体外项目还开源了VoiceMem 模型家族Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini和ChatMem-400K训练数据集——两者都由同一套三阶段 OPD 训练流程构建而成。本文将完整拆解这套流程记忆世界如何构建、在线同策略蒸馏OPD如何工作、人工精修如何落地以及你如何用仓库自带的微调代码训练自己的模型适配器。为什么语音模型需要懂记忆的训练数据大多数语音大模型有一个共同短板对话结束记忆清零。今天告诉它我对坚果过敏明天它照样推荐你吃花生酥。记忆系统比如 VoiceMem 的双脑架构负责把长期信息检索出来但还有一个问题模型本身不知道如何自然地使用这些记忆——把记忆逐字念给用户听、完全忽略记忆、或者在无关话题上强行关联都是常见问题。ChatMem-400K 正是为了解决这个问题它提供约 40 万条带记忆上下文的语音对话数据教模型学会「读到检索到的记忆 → 自然地融入回答 → 不破坏原本的口语能力」。而 VoiceMem 模型家族的三个基座——Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini——经过这套数据训练后都能在对话中主动调用记忆信息同时保留原有的语音理解与生成能力。三阶段OPD训练流程ChatMem-400K如何炼成整套数据生产流程分为三个阶段官方称之为OPDOnline On-Policy Distillation在线同策略蒸馏管线第一阶段记忆世界构建Memory-world construction这一步为训练搭建记忆世界构造大量虚拟用户让用户与语音模型进行长期、多话题的对话让 VoiceMem 的记忆管线在对话中持续抽取事实、情绪、偏好等记忆条目沉淀出结构化的记忆库。训练数据里的记忆上下文就是从这个持续生长的记忆世界中检索出来的——每条数据都对应一个聊了很久的用户而不是凭空拼贴的句子。第二阶段SLM验证的在线同策略蒸馏OPD这是整个流程的核心。与用教师模型生成的数据直接训练不同同策略on-policy意味着由学生模型自己按当前策略生成回复再由更强的教师模型对这些学生自己产出的回答进行验证与蒸馏纠错。这样做的好处是训练分布和推理分布一致模型学到的是我在真实对话中会犯错的地方而不是背教师模型的语料。数据形态上每一轮训练样本的结构都非常清晰记忆块以MEMORY CONTEXT的形式拼在最后一轮用户消息里历史轮不带记忆且只对最后一轮助手回复计算损失。仓库自带的样例数据可以直观看到这种格式覆盖 knowledge知识回忆、persona人格画像、emotion情绪共情、casual闲聊等类别训练数据样例finetune/data/sample.jsonl记忆块的渲染逻辑voicemem/memory_api.py 中的build_memory_context例如一条情感类样本用户说这周末想回趟家记忆块里带着用户父亲上个月做了心脏搭桥手术以及右脑的情绪归因记录模型需要回答得既贴心又不说教——这正是右脑情绪记忆训练模型的典型用法。第三阶段人工精修Human refinement模型蒸馏再强也难免留下不自然的措辞、事实性偏差或风格漂移。第三阶段引入人工编辑对蒸馏产物进行逐条精修把语料从机器可用提升到人类水准。经过人工编辑后的同一套管线产物同时形成了评测基准ChatMem-Bench——它专门评测一个语音模型能否在长期沉淀中逐渐形成对用户的理解而不是单轮问答能力。训练自己的适配器finetune/目录完全指南如果你想用自己的数据比如自己产品里积累的对话训练一个 VoiceMem 模型家族适配器仓库提供了完整的微调管线默认配置与已发布的checkpoint-3318完全一致照默认参数跑即可复现同一次训练。文件作用finetune/train.py训练入口基于 ms-swift 的 SFT 流程finetune/dataset.py读取 JSONL 并逐条校验格式不合规直接报出第几条第几句finetune/utils.py默认超参、四种 system prompt、warmup 换算finetune/eval.py用训好的适配器跑一遍数据逐条打印 ref / predfinetune/data/sample.jsonl5 条样例先把流程走通常用训练命令依赖ms-swift4.5.2与bitsandbytes默认基座为 Qwen3.6-35B-A3BLoRA rank 32 / alpha 644bit 量化python finetune/train.py # 先用自带的 5 条样例把流程走通 python finetune/train.py --data data/train.jsonl # 换成你的数据两个新手最容易踩的坑换基座必须改target_regexutils.py里的ADAPTER[target_modules]默认按 Qwen3.6-35B-A3B 的模块命名写死不确定就改成all-linear多卡训练时 warmup steps 要除以卡数否则学习率调度会失真。数据格式、显存要求等细节都写在 finetune/README.md 中训练前值得完整读一遍。用评测验证你的记忆能力模型家族训练完成后下一步是用仓库完全开源、可复现的评测流程验证效果。官方结果LoCoMo 91.2%Mem0 为 61.68%且只需 Top-5 条记忆、PersonaMem 69.44%、检索延迟134 ms、平均记忆仅302 token——准确率和成本同时占优。评测时回答模型只会收到检索到的记忆收不到原始对话历史——如果把完整对话丢给模型测的就变成阅读理解能力而不是记忆系统本身。一条命令即可跑起 Benchmarkexport OPENAI_API_KEYsk-... python evaluation/run.py \ --dataset locomo \ --data evaluation/examples/locomo_sample.json # 先跑小样例验证环境完整评测协议、参数说明和「添加新 Benchmark」的方法只需一个文件、两个函数见 evaluation/README.md 与 evaluation/run.py。小结一套流程两个产出回看整个体系设计思路非常克制而完整记忆世界构建造出有长期记忆沉淀的对话场景SLM 验证的在线同策略蒸馏让学生模型在自己的行为分布上学会使用记忆保住原有语音能力人工精修兜底质量顺手产出ChatMem-Bench评测集。同一套管线既产出了 40 万条训练语料ChatMem-400K也训练出能读记忆、用记忆的VoiceMem 模型家族还留下了一把量尺。配合记忆系统本体的流式双脑架构架构与流程详见 README.md从数据、模型到评测形成了完整闭环。如果你想给自己的语音智能体接入这套能力可以从 examples/03_simple_agent_with_voicemem_memory.py 跑起来——只需替换生成步骤记忆半边一行都不用改。【免费下载链接】VoiceMemInfrastructure for the next generation of voice agents, designed to provide universal memory. It is divided into a left brain and a right brain, storing information and emotions respectively, while a fully streaming architecture eliminates latency at the fundamental level.项目地址: https://gitcode.com/gh_mirrors/vo/VoiceMem创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表