唤醒词
相关资料
- Snowboy
Snowboy 是 KITT.AI(后被百度收购)2016 年推出的轻量级唤醒词框架,基于DTW(动态时间规整)+ 高斯混合模型(GMM),曾因轻量、开源被广泛使用,但如今被淘汰的核心原因:
1. 精度低:传统机器学习方法,抗噪性、远场识别率远低于深度学习模型;
2. 无硬件加速:仅支持 CPU 推理,无法利用移动端 / 嵌入式 NPU(瑞芯微 / 全志 / 高通 NPU);
3. 维护停止:2020 年后无更新,适配安卓 10+、新芯片架构(如 ARMv9)存在兼容性问题;
4. 定制化差:新增唤醒词需重新训练,且多唤醒词并发检测效率低。
- 深度学习轻量级模型
a.) CNN + DS-CNN
深度可分离卷积(Depthwise Separable CNN),参数量 < 100 万,推理 < 50ms
安卓端 / 嵌入式(瑞芯微 / 全志 NPU)
b.) CRNN/LSTM + CNN
结合时序特征(语音是时序数据),抗噪性更好,参数量≈200 万
远场唤醒(智能音箱)
c.) TDNN(时延神经网络
专为语音优化的时序卷积,低功耗,适配蓝牙耳机等超低算力设备
可穿戴设备(耳机 / 手表)
- 开源深度学习框架
a.) Porcupine
CNN + 量化
跨平台(安卓 / IOS/Linux),轻量
b.) HeySnips Wake Word
CRNN + 端侧优化
开源可商用,支持自定义唤醒词
c.) WeNet-WWD
TDNN + Transformer
语音识别 + 唤醒词一体化,中文优化
- 厂商自研唤醒词引擎
a.) 百度 UNIT 唤醒引擎 (安卓 / IoT 设备)
中文唤醒词优化,抗噪性强,支持自定义唤醒词
b.) 阿里 AliGenie (智能家居 / 车载)
远场唤醒(5 米 +),适配阿里智能音箱生态
c.) 高通 SNPE (安卓手机 / 蓝牙耳机)
深度适配高通骁龙 NPU,低功耗(<1mA)
d.) 瑞芯微 RKVoice (嵌入式安卓设备)
适配 RK3568/RK3588 NPU,推理 < 30ms
e.) 全志 AWVoice (耳机 / 手表 / 低功耗 IoT)
超低功耗(可穿戴设备),支持多唤醒词并发
落地方案
- 百度 UNIT 唤醒引擎
1. 官方文档
https://ai.baidu.com/ai-doc/SPEECH/3ltwvtg6u#%E5%94%A4%E9%86%92%E8%AF%8D
2. Android SDK
bdasr_V3_20250507_b610f20.jar
https://platform-new.cdn.bcebos.com/sdk/asr/android/baidu_speech_ASR_V3_20250521_b610f20_3.4.5.zip
WP_WORDS_FILE设置bin文件路径(唤醒词bin文件)
3. 预定义唤醒词
百度提供了近15个预定义唤醒词,一个bin文件最多包好10个唤醒词
已经支持的预定义唤醒词有:
相机类:拍照、茄子
音乐类:增大音量、减小音量、播放、停止、暂停、上一首、下一首
电灯类:打开电灯、关闭电灯、增大亮度、减小亮度
手电筒类:打开手电筒、关闭手电筒
4. 自定义唤醒词
自定义唤醒词不超过3个,http://ai.baidu.com/tech/speech/wake
5. 相关授权文件
使用APPID+包名首次联网自动下载授权文件进行验证(在联网时会获取自动获取离线正式授权。有特殊原因可用在官网下载临时授权文件)
需要用包名在百度平台创建相关KEY
6. 费用
离线的唤醒词应用的付费方式待确认
- 阿里 AliGenie
1. 官方文档
https://www.aligenie.com/doc/10974248/etqf5x
2. Android SDK
maven { url "http://mvnrepo.alibaba-inc.com/mvn/repository" }
implementation "com.alibaba.ailabs.genie:agui:{VERSION}"
implementation 'com.alibaba.ailabs.aligenie.opensdk:comm:{VERSION}'
implementation 'com.alibaba.ailabs.aligenie.opensdk:multirouter:{VERSION}'
3. 预定义唤醒词
28个
https://aligenie.com/doc/10974248/fnwsqv
4. 自定义唤醒词
个人开发未找到入口
- 瑞芯微 RKVoice
1. 官方文档
http://t.rock-chips.com
2. 自定义唤醒词
需要自己训练(官方是否有对应工具待定),声音样本需要提供,用于模型训练
3.
- 全志 AWVoice
1. 官方文档
https://www.aw-ol.com/
2. 自定义唤醒词
需要自己训练(官方是否有对应工具待定)
- aiui(讯飞)
1. 官方文档
https://aiui-doc.xf-yun.com/project-1/doc-22/
2. SDK
离线能力需联系讯飞商务申请线下提供AIUI SDK和引擎资源
3. 自定义唤醒词
通过https:/aiui.xfyun.cn/ 设置自定义唤醒词