ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

科研白痴读论文 Day2 (上一篇关于毒语音检测的下半部分)

科研白痴读论文 Day2 (上一篇关于毒语音检测的下半部分) 6.继ToxiAlert-Bench数据集如何制作之后 对于ToxiAlert-Bench数据集的详细介绍6.1先通过总体概览数据集的基本情况样本个数总语音时长。6.2接着对数据集进行深入的介绍文章从这两个大个角度展开详细的描述数据集第一个大角度 数据集自身的结构而言数据集包含两部分真实语音合成语音数据集又被划分为三个部分训练集、验证集和测试集每个音频样本均标注了三个关键属性第二个大角度数据集与其他数据集的对比在规模量和标注上对比 新的数据集完胜在毒性定义上DeToxy-B仅基于文本内容定义毒性所有5,077个有毒样本均通过纯文本分析进行标注。相比之下ToxiAlert-Bench引入了一种全新的毒性来源标注框架明确标注了样本为纯文本毒性6,953例、纯非语言毒性6,728例、兼具文本与非语言毒性的2,551例以及安全内容16,329例。这种细粒度的来源基础标注使研究人员能够开发出识别非语言毒性的模型。关于毒性类型标签D要更精细 种类更繁多 支持毒语言深度研究7.数据集框架构建构建流程思路 上文提到 接下来简写7.1从多个公开语音数据集中搜索相关语音7.2使用大模型进行初步的数据筛选和毒性评估。每个音频样本均通过结构化查询处理以判断其是否包含有害内容7.2在这一阶段多模态模型会从三个维度对每个音频样本及其描述进行分析毒性有毒/无毒、主要毒性类别和来源。当检测到有害内容时该样本将被归入四个主要毒性类别之一这些类别构成我们的粗粒度分类体系讽刺、恐怖、色情内容及其他有害内容D类原文7.3下一阶段 使用大模型提取有关毒性、粗粒度类别和来源的结构化标签建议。这些建议与多模态模型的输出结果结合以进行一致性检查。当两个模型在上述三个方面均达成一致时系统将自动分配相应标签 在此过程中标注员还会为每个被归类为D类的样本提供一段自由文本描述用以刻画其特定的毒性特征 做完这些后再用算法以揭示潜在的细粒度毒性类型标注员再修正聚类结果确保语义一致7.4合成数据建构合成过程始于GPT-4o生成具有情感色彩的句子涵盖心理恐怖和微妙性张力等毒性类别。使用DubbingXDubbingX2025进行音频合成。该TTS引擎具备丰富的角色性格配置只需提供输入文本并选择特定的角色即可生成具有不同语音风格的语音。有策略性地选择可能产生具有不同有毒非语言特征的语音角色。合成过程使我们能够生成具备多种非语言特征的自然语音确保最终音频的毒性通过语调、节奏和情感表达等非文本线索得以体现。原文7.5专家校对对于全部的数据进行详细评估1内容是否包含有害元素2毒性来源文本内容、非语言线索或两者兼有3具体的毒性类别8.统一检测模型ToxiAlert旨在识别有毒言语该毒性可能源自文本内容、非语言线索或二者结合。设计原则 文章先进行总体概述 后进行仔细描述1.使用自监督学习方式提升泛化能力这一段本人觉得较难理解借助了豆包 一下为豆包ai原文第一部分逐句拆解受深度伪造检测领域近期进展Tak et al. 2022的启发我之前省略的为什么深度伪造检测能启发毒性检测这两个领域看起来不相关但有一个共同的核心难题深度伪造检测要分辨真语音vsAI合成的假语音毒性检测要分辨正常语音vs有毒语音共同点是都需要模型能捕捉语音中细微的、人耳不一定注意到的特征。深度伪造检测领域先探索出了一条有效的路用自监督学习这篇论文就把这条路搬过来用。当前最先进的方法探索了自监督学习的应用通过仅使用真实样本训练于多样化的语音数据及其他任务以提升泛化能力。我之前省略的三个关键点① 仅使用真实样本这不是废话是一个刻意的设计选择。在深度伪造检测中自监督预训练阶段只拿真实语音来学不混入任何伪造样本。为什么因为如果预训练时就见过伪造样本模型可能只会记住见过的伪造类型遇到新的伪造技术就不行了。只学真实语音模型学到的是真实语音长什么样那么任何偏离真实模式的东西都会被察觉——这反而更通用。毒性检测同理预训练时只学正常语音的规律那么偏离正常模式的毒性特征就更容易被捕捉。② 多样化的语音数据我之前说了海量没标注的语音但多样化是重点。不是随便找一堆语音而是要覆盖不同说话人、不同语言、不同场景、不同录音设备。这样模型学到的是语音的通用规律而不是某个特定人群或场景的特征。泛化能力的来源之一就是数据多样性。③ 及其他任务这个我完全没讲。自监督学习不是随便听听就能学它需要通过**辅助任务pretext task**来驱动学习。以 Wav2Vec 2.0 为例它的预训练任务是把语音的一部分遮住mask让模型根据上下文预测被遮住的部分是什么就像英语完形填空我今天吃了___你能猜出来大概率是饭。模型通过做大量这种填空题被迫理解语音的结构和规律。其他任务指的就是这类不是最终目标、但用来逼模型学特征的辅助任务。预训练的自监督模型结合分类器后再用下游任务的数据集进行微调从而取得领先性能。我之前讲了两阶段但可以更精确整个流程是三阶段不是两阶段阶段1自监督预训练 - 用海量无标注语音 辅助任务如掩码预测 - 只学语音是什么不学什么是毒性 - 产出Wav2Vec 2.0 这个预训练好的编码器 阶段2接上分类头 - 在编码器后面加两个分类头来源头分类头 - 此时分类头是随机初始化的啥也不会 阶段3下游微调 - 用少量标注好的毒性检测数据每段音频标了有没有毒、哪种毒 - 端到端训练整个模型编码器分类头一起调 - 编码器微调不是完全冻住分类头从头学取得领先性能的原因阶段1已经让模型很懂语音了阶段3只需要在这个基础上学毒性判断比从零开始学效果好得多而且需要的标注数据也少得多。补全后的完整逻辑链深度伪造检测发现自监督学习 只用真实样本预训练 → 泛化好 │ ▼ 借鉴到毒性检测 用海量、多样化的真实语音通过掩码预测等辅助任务预训练 │ ▼ 得到一个很懂语音通用规律的编码器Wav2Vec 2.0 │ ▼ 接上两个分类头用毒性标注数据微调 │ ▼ 最终模型既能判断毒从哪来又能判断是哪种毒2.采用 Wav2Vec 2.0 作为语音编码器fθ就是这个模型本身θ 代表模型的参数不用管X → Rd意思是输入是音频输出是 d 维的数字向量h ∈ R^(T×d)意思是输出 h 是一个 T 行 d 列的矩阵T 是时间帧数d 是每帧的特征维度类比就像你耳朵听到声音后大脑先把它转换成 你能理解的信号。Wav2Vec 2.0 就是那个 耳朵 初步处理 的部分把 raw 声音变成机器能理解的特征。一段语音的 毒 可能来自两个地方文本内容说的话本身就有毒比如 你去死非语言线索话本身没毒但语气、音调、嘶吼方式有毒比如用恶狠狠的语气说 你好这个头要分别判断这两种来源各自的概率ŷ(s) ∈ [0,1]² → 输出两个数都在 0 到 1 之间比如输出 [0.9, 0.3] 表示90% 概率文本有毒30% 概率非语言有毒Sigmoid就是把每个数单独压到 0-1 之间两个概率互不影响可以同时高也可以同时低叫 多标签 是因为两个标签可以同时为真文本和非语言都有毒② 分类头 gϕ(c)判断具体是哪种毒多分类分类头确定具体毒性类型…… 七个有毒类别和一个安全类别翻译这个头要从8 个互斥类别里选一个7 种有毒类型比如辱骂、威胁、仇恨、骚扰……1 种安全无毒ŷ(c) ∈ [0,1]^K → 输出 K 个数K8加起来等于 1Softmax把 8 个数变成概率分布最大的那个就是预测结果叫 多分类 是因为 8 个类别互斥一段音频只能属于其中一种
返回列表