Paraformer模型介绍

ModelScope-FunASR

FunASR希望在语音识别方面建立学术研究和工业应用之间的桥梁。通过支持在ModelScope上发布的工业级语音识别模型的训练和微调，研究人员和开发人员可以更方便地进行语音识别模型的研究和生产，并促进语音识别生态系统的发展。

项目介绍

Paraformer是达摩院语音团队提出的一种高效的非自回归端到端语音识别框架。本项目为Paraformer中文通用语音识别模型，采用工业级数万小时的标注音频进行模型训练，保证了模型的通用识别效果。模型可以被应用于语音输入法、语音导航、智能会议纪要等场景。

Paraformer模型结构由 Encoder、Predictor、Sampler、Decoder 与 Loss function 五部分组成。Encoder可以采用不同的网络结构，例如self-attention，conformer，SAN-M等。Predictor 为两层FFN，预测目标文字个数以及抽取目标文字对应的声学向量。Sampler 为无可学习参数模块，依据输入的声学向量和目标向量，生产含有语义的特征向量。Decoder 结构与自回归模型类似，为双向建模（自回归为单向建模）。Loss function 部分，除了交叉熵（CE）与 MWER 区分性优化目标，还包括了 Predictor 优化目标 MAE。

其核心点主要有：

Predictor 模块：基于 Continuous integrate-and-fire (CIF) 的预测器 (Predictor) 来抽取目标文字对应的声学特征向量，可以更加准确的预测语音中目标文字个数。
Sampler：通过采样，将声学特征向量与目标文字向量变换成含有语义信息的特征向量，配合双向的 Decoder 来增强模型对于上下文的建模能力。
基于负样本采样的 MWER 训练准则。

更详细的细节见：

如何训练自己的Paraformer模型？

本项目提供的Paraformer是基于AISHELL-1的识别模型，开发者可以基于此模型进一步利用MaaSlib的finetuning功能或者本项目对应的github代码仓库进一步进行模型的领域定制化。

基于github的模型训练和推理

FunASR框架支持魔搭社区开源的工业级的语音识别模型的training & finetuning，使得研究人员和开发者可以更加便捷的进行语音识别模型的研究和生产，目前已在github开源：https://github.com/alibaba-damo-academy/FunASR。

#### 微调：加载训练好的模型，采用私有或者开源数据进行模型训练。
```sh
cd egs/aishell/paraformer
# 配置 run.sh 中参数
# CUDA_VISIBLE_DEVICES: 可用的gpu list
# gpu_num: 训练使用的gpu数量
# feats_dir: 数据准备输出目录
# exp_dir: 模型输出路径
# tag: 模型保存后缀名
# init_param: 初始模型路径
# 配置修改完成后，执行命令: 
bash run.sh --stage 3 --stop_stage 3

推理

cd egs/aishell/paraformer
# 配置 run.sh 中参数
# CUDA_VISIBLE_DEVICES: 可用的gpu list
# gpu_num: 训练使用的gpu数量
# njob: 一块gpu解码的线程数
# feats_dir: 数据准备输出目录
# exp_dir: 模型输出路径
# tag: 模型保存后缀名
# 配置修改完成后，执行命令: 
bash run.sh --stage 4 --stop_stage 4

基于MaaSlib的模型训练和推理

正在对接中，预计12月底完成接入，敬请期待。

数据评估及结果

model	dev(CER%)	test(CER%)	RTF
Paraformer	4.66	5.11	0.0168

使用方式以及适用范围

运行范围

支持Linux-x86_64、Mac和Windows运行。

使用方式

直接推理：可以直接对输入音频进行解码，输出目标文字。
微调：加载训练好的模型，采用私有或者开源数据进行模型训练。

使用范围与目标场景

适合与离线语音识别场景，如录音文件转写，配合GPU推理效果更加，推荐输入语音时长在20s以下。

模型局限性以及可能的偏差

考虑到特征提取流程和工具以及训练工具差异，会对CER的数据带来一定的差异（<0.1%），推理GPU环境差异导致的RTF数值差异。

Paraformer模型介绍

ModelScope-FunASR

项目介绍

其核心点主要有：

Predictor 模块：基于 Continuous integrate-and-fire (CIF) 的预测器 (Predictor) 来抽取目标文字对应的声学特征向量，可以更加准确的预测语音中目标文字个数。
Sampler：通过采样，将声学特征向量与目标文字向量变换成含有语义信息的特征向量，配合双向的 Decoder 来增强模型对于上下文的建模能力。
基于负样本采样的 MWER 训练准则。

更详细的细节见：

如何训练自己的Paraformer模型？

基于github的模型训练和推理

#### 微调：加载训练好的模型，采用私有或者开源数据进行模型训练。
```sh
cd egs/aishell/paraformer
# 配置 run.sh 中参数
# CUDA_VISIBLE_DEVICES: 可用的gpu list
# gpu_num: 训练使用的gpu数量
# feats_dir: 数据准备输出目录
# exp_dir: 模型输出路径
# tag: 模型保存后缀名
# init_param: 初始模型路径
# 配置修改完成后，执行命令: 
bash run.sh --stage 3 --stop_stage 3

推理

cd egs/aishell/paraformer
# 配置 run.sh 中参数
# CUDA_VISIBLE_DEVICES: 可用的gpu list
# gpu_num: 训练使用的gpu数量
# njob: 一块gpu解码的线程数
# feats_dir: 数据准备输出目录
# exp_dir: 模型输出路径
# tag: 模型保存后缀名
# 配置修改完成后，执行命令: 
bash run.sh --stage 4 --stop_stage 4

基于MaaSlib的模型训练和推理

正在对接中，预计12月底完成接入，敬请期待。

数据评估及结果

model	dev(CER%)	test(CER%)	RTF
Paraformer	4.66	5.11	0.0168

使用方式以及适用范围

运行范围

支持Linux-x86_64、Mac和Windows运行。

使用方式

直接推理：可以直接对输入音频进行解码，输出目标文字。
微调：加载训练好的模型，采用私有或者开源数据进行模型训练。

使用范围与目标场景

适合与离线语音识别场景，如录音文件转写，配合GPU推理效果更加，推荐输入语音时长在20s以下。

模型局限性以及可能的偏差

考虑到特征提取流程和工具以及训练工具差异，会对CER的数据带来一定的差异（<0.1%），推理GPU环境差异导致的RTF数值差异。

Paraformer模型介绍

ModelScope-FunASR

项目介绍

如何训练自己的Paraformer模型？

基于github的模型训练和推理

推理

基于MaaSlib的模型训练和推理

数据评估及结果

使用方式以及适用范围

模型局限性以及可能的偏差

相关论文以及引用信息

Paraformer模型介绍

ModelScope-FunASR

项目介绍

如何训练自己的Paraformer模型？

基于github的模型训练和推理

推理

基于MaaSlib的模型训练和推理

数据评估及结果

使用方式以及适用范围

模型局限性以及可能的偏差

相关论文以及引用信息