2021-12-31

mkws 文档

1. 环境搭建 (conda)

1)创建指定Python版本的conda虚拟环境:conda create -n 环境名称 python=3.6.2

2)安装Pytorch及对应版本的cuda-toolkit:conda install pytorch torchvision torchaudio cudatoolkit=11.1 -c pytorch -c conda-forge

3)安装Pytorch-Lightning框架:conda install pytorch-lightning -c conda-forge

补充说明:

1)文档cuda 版本: 11.1.114

2)也可使用ASR文档中创建的Nemo环境,无需安装其他包和依赖。当前环境适用于原生Pytorch搭建的工程。

3)服务器环境:/aidate/home/aiyy_env (Nemo环境)


2. Nemo工程

1)项目路径:/aidate/home/aiyy/kws_dataset

2)项目结构信息详见 note.txt 文档


3. Pytorch工程

1)项目路径:/aidate/home/share_yy/KWS_PL_LINUX_1116 或 ~/KWS_PL_LINUX_1201

2)项目结构信息详见 note.txt 文档


4. 参考模型

1)论文链接:/aidate/home/share_yy/MatchboxNet.pdf 或 arXiv地址

2)模型信息:一维全卷积网络,层与层之间存在残差级联结构,总参数量为77k(全精度32位)。


5. 程序说明

1)训练流程

a)生成数据集对应的MFCC特征文件,以tensor(.pt)形式保存。或者创建JSON数据集映射:

-- Tensor文件格式:(index, 特征维数, 时间帧数) 

eg.  ->  (10000,64,93):10000个音频,64维MFCC特征,padding或者clip到93帧

-- JSON数据集格式:{"audio_filepath": "path", "duration": 1.2, "command": "打开灯光"}

b)设置相应的超参数和训练策略(学习率,batch_size,epoch etc.)

补充说明:

-- Lightning框架在启动训练后会自动生成Lightning_logs文件夹储存当前训练状态,支持Tensorboard可视化

2)测试方法

a)batch测试:抽取数据集部分样本,以batch的形式输入模型获取输出

b)在线测试:获取当前麦克风录音设备输入,实时输出结果(策略待调整)

c)长音频流式测试:输入长音频(含多次唤醒词),输出并统计唤醒信息(策略待调整)


最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • ASR 文档 1. 环境搭建 (conda) 1)创建指定Python版本的conda虚拟环境:conda cre...
    yoyo君阅读 479评论 0 1
  • 首先特别感谢自己有勇气做了智者君 突破了自己的畏难情绪 感谢主持人和小伙伴向自己提问题让我看到了自己的视觉盲点 对...
    莫忘小寒阅读 299评论 0 0
  • 从生活一地鸡毛, 变成能量满满 ,我做对了哪些 ? 在2010年那年,我20岁,懵懵懂懂的结了婚,生了娃,因为和老...
    雨霏_阅读 196评论 0 0
  • 规则意识的培养,为幼儿创设良好的心理成长环境。心理学家皮亚杰的相互作用论告诉我们,儿童的认知发展是在其不断...
    晴子葭月阅读 175评论 0 0
  • 哈喽大家好,我是一个十九岁的女生,长斑长痘是我最害怕的事情,经常也会出现身体乏力,食欲不振,口干口苦的现象,一直不...
    顺昌葫芦娃阅读 174评论 0 0

友情链接更多精彩内容