这个是自用的 不是分享 写的很糙

摘要

意思就是transformer在自动语音识别(ASR)领域占据主导地位,尽管其性能优异,但是由于是采用自回归(AR)解码器逐token 生成输出,导致计算效率低下。为了加速推理,研究者设计了非自回归(NAR)方法(如单步NAR),实现并行生成。然而,由于输出token间存在独立性假设,单步NAR的性能(尤其是大规模语料下)仍逊于AR模型

自回归就是逐个token生成 上一个时刻的输出会作为隐变量作为下一个时刻的输入 坏处就是速度会慢 但是这样的好处就是各个生成词之间的联系是非常紧密的   transfomer在ASR占据主导地位的意思并不是说它就只是自回归解码 它也可以非自回归 就比如gpt就是自回归 但是paraformer就是非自回归)

然后是由自回归还是非自回归依赖于底层的机制和代码编写 就比如自回归的话

针对于非自回归 (不考虑Paraformer的创新点) 非自回归模型中的长度预测+并行生成 

为什么要进行长度预测?

语音和文本的输入输出长度是不对齐的(一秒语音对应的文字是不确定的 )

NAR:挑战就是并行生成需预先知道输出序列长度 才能构建才能构建[Batch, T_out, V]的logits矩阵。(T-out的意思是一句话的最大长度 v代表的是输出句子所包含的所有可能的词汇)

所以使用非自回归解码一定会涉及到长度预测问题,那么这也可能会是一个优化的思路

(如何可以提升预测的精度、是否具备动态长度的功能等)

针对于并行生成,并行生成依赖于1.输入表征,编码器输出的上下文向量。2.长度信息,预测的T—out定输出矩阵维度(也就是刚刚那个包含三个变量的矩阵)。3.独立性假设:每个输出的token仅仅依赖输入,不依赖彼此

(来解释一下。并行生成依赖于这三点。编码器输出的上下文向量意思就是比如说输入一段语音,语音帧会通过CNN+Transformer编码后,每个时间步的向量包括声学和语义信息。针对于独立性假设而言,transformer确实会看到全局关系,那么肯定不会是独立的 但是联系很弱 所以这部分肯定还是要去加强的 )​

那么对于token之间词的联系也是要加强的,针对于这个词之间的联系加强(截止到2024)。

方法​ 案例项目 FunASR适配性 效果提升(AISHELL-1)
​GLM采样器​(轻量AR引导) 阿里达摩院Paraformer ✅ 直接兼容 CER↓12%
对比学习​不开源 微软UniSpeech-SAT ✅ 需改损失函数 领域术语WER↓15%
​知识蒸馏​ NVIDIA Riva ASR ✅ 需AR教师模型 CER↓8%
​CRF约束​ 字节跳动Neural-CRF-ASR ⚠️ 需修改解码器 医疗文本CER↓20%

目前改进单步NAR的两大挑战,一是准确预测输出token数量并提取隐变量,二是增强输出token间依赖关系的建模能力 为了解决这些问题 本文提出一种快读而且高精度的并行 transformer-Paraformer。其核心包括:

  • 连续积分发射预测器​​(Continuous Integrate-and-Fire Predictor):动态预测 token 数量并生成隐变量;
  • GLM采样器​​(GLM Sampler  glancing language model):生成语义嵌入,增强 NAR 解码器对上下文依赖的建模能力;
  • ​最小词错误率训练的负样本生成策略​​:进一步提升性能(提升鲁棒性)。

动态长度+语法约束​​:最易落地,FunASR社区已有相关PR(如DynamicCIF)。

引言

近年来,端到端(E2E)模型在自动语音识别(ASR)任务上的表现已超越传统混合系统。目前主流的E2E方法包括:

  1. ​连接时序分类(CTC)​​[1]
  2. ​循环神经网络转录器(RNN-T)​​[2]
  3. ​基于注意力的编码器-解码器(AED)​​[3,4]

其中,​​AED模型​​(如Transformer[4]和Conformer[5])因识别精度最高,成为ASR序列建模的主流方案。但其​​自回归(AR)解码器​​需逐token生成输出(每个token依赖之前所有token),导致计算效率低下,且解码时间与输出序列长度呈线性增长。

为提升效率,研究者提出​​非自回归(NAR)模型​​[6-8],支持并行生成整个序列。根据推理时的迭代次数,NAR模型可分为:

  • ​迭代式​​(多次修正)
  • ​单步式​​(一次生成)

在迭代式NAR模型中,​​A-FMLM​​[9] 是早期尝试,其通过固定次数的迭代预测被遮盖的token(以未遮盖token为条件)。但由于需​​预先设定目标token长度​​,性能受限。为解决此问题,​​Mask-CTC​​及其变体[10-12]提出用CTC解码结果增强解码器输入。即便如此,这些迭代式NAR模型仍需多次迭代才能获得有竞争力的结果,限制了实际推理速度。

近期,研究者提出多种​​单步式NAR模型​​[13-17]以突破此限制。这些模型通过消除时序依赖关系​​并行生成输出序列​​。虽然单步式NAR能显著提升推理速度,但其识别精度(尤其是大规模语料库上)仍显著劣于AR模型。

上述单步式NAR研究主要聚焦于​​如何准确预测token数量及提取隐变量​​。与机器翻译(通过预测网络确定token数)不同,ASR因​​语速、静默、噪声​​等因素使该任务更具挑战性。此外,我们发现单步式NAR相比AR模型会产生更多​​替换错误​​(如图1中AR与基础NAR对比)。我们认为,​​上下文依赖的缺失​​(由单步式NAR的条件独立性假设导致)是主因。

需注意的是,现有NAR模型仅在朗读式学术数据集上验证,尚未在​​工业级大规模语料库​​中评估性能。因此,本文旨在改进单步式NAR模型,使其在大规模语料上达到与AR模型相当的识别性能。

paraformer采用非自回归(NAR)主体+自回归(AR)辅助信号 左侧是输入特征到隐变量的编码 右侧是并行双向(上下文)解码器

左侧是语音信号预处理之后输入 然后进行编码 输出语音隐变量和预测的数目

预测的数目输入到右侧 右侧分为两轮 一个是没有(用AR模型(如TinyGPT)生成伪标签,作为语义嵌入(Teacher-Student蒸馏))) 一个是有梯度,联合优化NAR解码器,融合声学嵌入Ea与语义嵌入

GLM采样器会输入第一轮的伪标签和原始声学嵌入 输出语义增强的隐变量,缓解NAR的独立性假设 

然后还有一些针对于语音识别方面的损失函数

CE损失:常规分类损失

MWER损失:通过负样本吗,对抗替换错误

​4. 创新点总结​

​技术​

解决的问题

工业价值

​动态CIF​

语音-文本长度不对齐

支持任意语速输入,长度误差<5%

​GLM采样器​

NAR的token间依赖缺失

替换错误率↓40%(如“天汽”→“天气”)

​两轮训练​

蒸馏AR知识到NAR模型

保持NAR速度,逼近AR精度

​MWER优化​

直接降低词错误率

领域术语识别准确率↑15%


​5. 与同类架构对比​

​模型​

训练方式

实时率(RTF)

CER(AISHELL-1)

AR Transformer

自回归

0.6

4.6%

Vanilla NAR

非自回归

0.05

6.8%

​Paraformer​

混合训练

​0.05​

​5.2%​

 ​​协同流程​
  1. ​非AR首轮生成​​:
    • 编码器输出声学特征H → CIF预测器生成Ea → NAR解码器输出粗粒度文本(可能含错误)。
  2. ​AR语义修正​​:
    • 粗文本输入GLM采样器 → AR模型生成概率分布 → 与Ea融合后送入第二轮回调。
  3. ​联合训练​​:
    • ​Pass1(无梯度)​​:冻结GLM,仅生成伪标签。
    • ​Pass2(有梯度)​​:优化NAR解码器,使其学会利用AR信号。

​2. 架构图中的对应位置​

  • ​输入流​​:
    fbanksencoderH → ​​分两路​
    • predictorEa(纯NAR路径,非AR)
    • char tokens → ​sampler​ → semantic embedding(AR干预路径)
  • ​融合点​​:
    Ea + semantic embeddingparallel bi-decoder(联合训练)

​3. 设计动机​

​技术需求​ AR的贡献 非AR的贡献
​速度​ 仅轻量干预(参数量<1%) 主体并行生成(RTF≈0.05)
​精度​ 建模token依赖(如“北京→天气”) 全局声学特征提取
​工业适配​ 领域定制(如医疗GLM) 支持动态长度预测(CIF)

​4. 实例说明​

假设输入语音为“/jīn tiān tiān qì/”:

  1. ​NAR首轮输出​​:“今天天汽”(错误)。
  2. ​GLM采样器​​:
    • AR模型分析“今天”后接“天气”概率>“天汽” → 生成修正信号。
  3. ​最终输出​​:“今天天气”。

​5. 对比纯AR/纯NAR​

​模型​ 生成方式 依赖处理 CER(AISHELL-1)
纯AR(GPT式) 逐token 完全依赖前序token 4.6%
纯NAR 并行 无依赖(独立性假设) 6.8%
​Paraformer​ 并行+AR修正 ​局部依赖(GLM)​ ​5.2%​

​总结​

AR与非AR的结合​​并非显式串联​​,而是通过:

  1. ​GLM采样器​​隐式注入AR的序列知识。
  2. ​两阶段训练​​分离AR与NAR的优化目标。
  3. ​动态融合​​在推理时保持NAR速度。

如需标注版架构图或GLM采样器的具体实现代码,可进一步提供!

方法

过程先不进行分析了 我要直接上手了
概览
预测
采样
损失函数

实验

最右侧那列是超参数 第一行指的是模型 CTC是连接时序分类 与transformer不在一起 然后模型分为三个 对于dynamic B是否启用动态阈值CIF,MWER是否启动最小词错误率训练 RTF反映的是推理速率  far-filed 和 common 指的是远景录音和近景录音 试验不同情况

讨论

将Paraformer与外部语言模型结合,进一步缩小差距 推理时用Bert等模型重打分NAR输出 联合训练NAR+LM(如蒸馏LM知识到GLM)

GPT增强语义嵌入是指​​利用类似GPT的大规模语言模型(LLM)生成高质量的语义表示​​,并将这些表示注入到非自回归(NAR)语音识别模型中,以弥补其因并行生成导致的上下文依赖不足问题

结合LLM时代新范式

语音-文本联合训练 

用ASR转录结果+GPT生成文本构建对比学习任务(simcse),拉进同语义语音与文本的嵌入距离

数据配方:混合纯净数据和早上数据 提升鲁棒性

大模型蒸馏技术 伪标签?啥意思呢 这里可以使用到什么伪呢

​项目​ 核心创新 可借鉴点 融合可行性评估
​UniASR​ 多模态输入(语音+唇动) 噪声场景CER↓15% 需增加摄像头输入模块
​NAR-T++​ 混合AR/NAR的动态切换 长语音首遍NAR+局部AR修正 需修改FunASR解码架构
​SpeechGPT​ 语音直接生成文本+执行指令 可扩展ASR为语音助手 需重训练端到端Pipeline

    Logo

    中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

    更多推荐