funasr调研
这个是自用的 不是分享 写的很糙
摘要
意思就是transformer在自动语音识别(ASR)领域占据主导地位,尽管其性能优异,但是由于是采用自回归(AR)解码器逐token 生成输出,导致计算效率低下。为了加速推理,研究者设计了非自回归(NAR)方法(如单步NAR),实现并行生成。然而,由于输出token间存在独立性假设,单步NAR的性能(尤其是大规模语料下)仍逊于AR模型
(自回归就是逐个token生成 上一个时刻的输出会作为隐变量作为下一个时刻的输入 坏处就是速度会慢 但是这样的好处就是各个生成词之间的联系是非常紧密的 transfomer在ASR占据主导地位的意思并不是说它就只是自回归解码 它也可以非自回归 就比如gpt就是自回归 但是paraformer就是非自回归)

然后是由自回归还是非自回归依赖于底层的机制和代码编写 就比如自回归的话

针对于非自回归 (不考虑Paraformer的创新点) 非自回归模型中的长度预测+并行生成
为什么要进行长度预测?
语音和文本的输入输出长度是不对齐的(一秒语音对应的文字是不确定的 )
NAR:挑战就是并行生成需预先知道输出序列长度 才能构建才能构建[Batch, T_out, V]的logits矩阵。(T-out的意思是一句话的最大长度 v代表的是输出句子所包含的所有可能的词汇)
所以使用非自回归解码一定会涉及到长度预测问题,那么这也可能会是一个优化的思路
(如何可以提升预测的精度、是否具备动态长度的功能等)
针对于并行生成,并行生成依赖于1.输入表征,编码器输出的上下文向量。2.长度信息,预测的T—out定输出矩阵维度(也就是刚刚那个包含三个变量的矩阵)。3.独立性假设:每个输出的token仅仅依赖输入,不依赖彼此
(来解释一下。并行生成依赖于这三点。编码器输出的上下文向量意思就是比如说输入一段语音,语音帧会通过CNN+Transformer编码后,每个时间步的向量包括声学和语义信息。针对于独立性假设而言,transformer确实会看到全局关系,那么肯定不会是独立的 但是联系很弱 所以这部分肯定还是要去加强的 )
那么对于token之间词的联系也是要加强的,针对于这个词之间的联系加强(截止到2024)。
| 方法 | 案例项目 | FunASR适配性 | 效果提升(AISHELL-1) |
|---|---|---|---|
| GLM采样器(轻量AR引导) | 阿里达摩院Paraformer | ✅ 直接兼容 | CER↓12% |
| 对比学习不开源 | 微软UniSpeech-SAT | ✅ 需改损失函数 | 领域术语WER↓15% |
| 知识蒸馏 | NVIDIA Riva ASR | ✅ 需AR教师模型 | CER↓8% |
| CRF约束 | 字节跳动Neural-CRF-ASR | ⚠️ 需修改解码器 | 医疗文本CER↓20% |
目前改进单步NAR的两大挑战,一是准确预测输出token数量并提取隐变量,二是增强输出token间依赖关系的建模能力 为了解决这些问题 本文提出一种快读而且高精度的并行 transformer-Paraformer。其核心包括:
- 连续积分发射预测器(Continuous Integrate-and-Fire Predictor):动态预测 token 数量并生成隐变量;
- GLM采样器(GLM Sampler glancing language model):生成语义嵌入,增强 NAR 解码器对上下文依赖的建模能力;
- 最小词错误率训练的负样本生成策略:进一步提升性能(提升鲁棒性)。
动态长度+语法约束:最易落地,FunASR社区已有相关PR(如DynamicCIF)。
引言
近年来,端到端(E2E)模型在自动语音识别(ASR)任务上的表现已超越传统混合系统。目前主流的E2E方法包括:
- 连接时序分类(CTC)[1]
- 循环神经网络转录器(RNN-T)[2]
- 基于注意力的编码器-解码器(AED)[3,4]
其中,AED模型(如Transformer[4]和Conformer[5])因识别精度最高,成为ASR序列建模的主流方案。但其自回归(AR)解码器需逐token生成输出(每个token依赖之前所有token),导致计算效率低下,且解码时间与输出序列长度呈线性增长。
为提升效率,研究者提出非自回归(NAR)模型[6-8],支持并行生成整个序列。根据推理时的迭代次数,NAR模型可分为:
- 迭代式(多次修正)
- 单步式(一次生成)
在迭代式NAR模型中,A-FMLM[9] 是早期尝试,其通过固定次数的迭代预测被遮盖的token(以未遮盖token为条件)。但由于需预先设定目标token长度,性能受限。为解决此问题,Mask-CTC及其变体[10-12]提出用CTC解码结果增强解码器输入。即便如此,这些迭代式NAR模型仍需多次迭代才能获得有竞争力的结果,限制了实际推理速度。
近期,研究者提出多种单步式NAR模型[13-17]以突破此限制。这些模型通过消除时序依赖关系并行生成输出序列。虽然单步式NAR能显著提升推理速度,但其识别精度(尤其是大规模语料库上)仍显著劣于AR模型。
上述单步式NAR研究主要聚焦于如何准确预测token数量及提取隐变量。与机器翻译(通过预测网络确定token数)不同,ASR因语速、静默、噪声等因素使该任务更具挑战性。此外,我们发现单步式NAR相比AR模型会产生更多替换错误(如图1中AR与基础NAR对比)。我们认为,上下文依赖的缺失(由单步式NAR的条件独立性假设导致)是主因。
需注意的是,现有NAR模型仅在朗读式学术数据集上验证,尚未在工业级大规模语料库中评估性能。因此,本文旨在改进单步式NAR模型,使其在大规模语料上达到与AR模型相当的识别性能。

paraformer采用非自回归(NAR)主体+自回归(AR)辅助信号 左侧是输入特征到隐变量的编码 右侧是并行双向(上下文)解码器
左侧是语音信号预处理之后输入 然后进行编码 输出语音隐变量和预测的数目
预测的数目输入到右侧 右侧分为两轮 一个是没有(用AR模型(如TinyGPT)生成伪标签,作为语义嵌入(Teacher-Student蒸馏))) 一个是有梯度,联合优化NAR解码器,融合声学嵌入Ea与语义嵌入
GLM采样器会输入第一轮的伪标签和原始声学嵌入 输出语义增强的隐变量,缓解NAR的独立性假设
然后还有一些针对于语音识别方面的损失函数
CE损失:常规分类损失
MWER损失:通过负样本吗,对抗替换错误
4. 创新点总结
|
技术 |
解决的问题 |
工业价值 |
|---|---|---|
|
动态CIF |
语音-文本长度不对齐 |
支持任意语速输入,长度误差<5% |
|
GLM采样器 |
NAR的token间依赖缺失 |
替换错误率↓40%(如“天汽”→“天气”) |
|
两轮训练 |
蒸馏AR知识到NAR模型 |
保持NAR速度,逼近AR精度 |
|
MWER优化 |
直接降低词错误率 |
领域术语识别准确率↑15% |
5. 与同类架构对比
|
模型 |
训练方式 |
实时率(RTF) |
CER(AISHELL-1) |
|---|---|---|---|
|
AR Transformer |
自回归 |
0.6 |
4.6% |
|
Vanilla NAR |
非自回归 |
0.05 |
6.8% |
|
Paraformer |
混合训练 |
0.05 |
5.2% |
协同流程
- 非AR首轮生成:
- 编码器输出声学特征
H→ CIF预测器生成Ea→ NAR解码器输出粗粒度文本(可能含错误)。
- 编码器输出声学特征
- AR语义修正:
- 粗文本输入GLM采样器 → AR模型生成概率分布 → 与
Ea融合后送入第二轮回调。
- 粗文本输入GLM采样器 → AR模型生成概率分布 → 与
- 联合训练:
- Pass1(无梯度):冻结GLM,仅生成伪标签。
- Pass2(有梯度):优化NAR解码器,使其学会利用AR信号。
2. 架构图中的对应位置
- 输入流:
fbanks→encoder→H→ 分两路- ①
predictor→Ea(纯NAR路径,非AR) - ②
char tokens→ sampler →semantic embedding(AR干预路径)
- ①
- 融合点:
Ea+semantic embedding→parallel bi-decoder(联合训练)
3. 设计动机
| 技术需求 | AR的贡献 | 非AR的贡献 |
|---|---|---|
| 速度 | 仅轻量干预(参数量<1%) | 主体并行生成(RTF≈0.05) |
| 精度 | 建模token依赖(如“北京→天气”) | 全局声学特征提取 |
| 工业适配 | 领域定制(如医疗GLM) | 支持动态长度预测(CIF) |
4. 实例说明
假设输入语音为“/jīn tiān tiān qì/”:
- NAR首轮输出:“今天天汽”(错误)。
- GLM采样器:
- AR模型分析“今天”后接“天气”概率>“天汽” → 生成修正信号。
- 最终输出:“今天天气”。
5. 对比纯AR/纯NAR
| 模型 | 生成方式 | 依赖处理 | CER(AISHELL-1) |
|---|---|---|---|
| 纯AR(GPT式) | 逐token | 完全依赖前序token | 4.6% |
| 纯NAR | 并行 | 无依赖(独立性假设) | 6.8% |
| Paraformer | 并行+AR修正 | 局部依赖(GLM) | 5.2% |
总结
AR与非AR的结合并非显式串联,而是通过:
- GLM采样器隐式注入AR的序列知识。
- 两阶段训练分离AR与NAR的优化目标。
- 动态融合在推理时保持NAR速度。
如需标注版架构图或GLM采样器的具体实现代码,可进一步提供!
方法
过程先不进行分析了 我要直接上手了
概览
预测
采样
损失函数
实验

最右侧那列是超参数 第一行指的是模型 CTC是连接时序分类 与transformer不在一起 然后模型分为三个 对于dynamic B是否启用动态阈值CIF,MWER是否启动最小词错误率训练 RTF反映的是推理速率 far-filed 和 common 指的是远景录音和近景录音 试验不同情况
讨论
将Paraformer与外部语言模型结合,进一步缩小差距 推理时用Bert等模型重打分NAR输出 联合训练NAR+LM(如蒸馏LM知识到GLM)
GPT增强语义嵌入是指利用类似GPT的大规模语言模型(LLM)生成高质量的语义表示,并将这些表示注入到非自回归(NAR)语音识别模型中,以弥补其因并行生成导致的上下文依赖不足问题
结合LLM时代新范式
语音-文本联合训练
用ASR转录结果+GPT生成文本构建对比学习任务(simcse),拉进同语义语音与文本的嵌入距离
数据配方:混合纯净数据和早上数据 提升鲁棒性
大模型蒸馏技术 伪标签?啥意思呢 这里可以使用到什么伪呢
| 项目 | 核心创新 | 可借鉴点 | 融合可行性评估 |
|---|---|---|---|
| UniASR | 多模态输入(语音+唇动) | 噪声场景CER↓15% | 需增加摄像头输入模块 |
| NAR-T++ | 混合AR/NAR的动态切换 | 长语音首遍NAR+局部AR修正 | 需修改FunASR解码架构 |
| SpeechGPT | 语音直接生成文本+执行指令 | 可扩展ASR为语音助手 | 需重训练端到端Pipeline |
更多推荐



所有评论(0)