项目背景
在传统办公场景中,填写各种表单是一项重复且繁琐的工作。无论是采购入库单、费用报销单还是质检单,都需要用户手动输入大量信息,不仅效率低下,还容易出错。
随着人工智能技术的发展,语音识别和自然语言处理技术已经相当成熟。我们思考:能否通过语音交互的方式,让用户"说"完表单,系统自动识别并填写相关信息?
基于这个想法,开发了AI语音填单系统——一个集成了语音识别、自然语言理解、语音合成等技术的智能表单填写解决方案。
系统概述
AI语音填单系统是一个端到端的语音交互应用,用户只需通过语音描述填写内容,系统就能自动识别语音内容、理解语义、提取表单字段信息,并完成表单填写。整个过程无需手动输入,极大提升了工作效率。
核心功能
- 语音唤醒:用户可以通过语音指令快速启动填单流程
- 语音识别:将用户的语音输入转换为文本
- 语义理解:智能识别语音中的关键信息并映射到表单字段
- 智能校验:自动检查填写内容的完整性和合法性
- 语音反馈:通过语音播报填写结果,确认信息准确性
- 模板管理:支持多种表单模板,灵活配置字段和规则
技术架构
系统采用前后端分离架构,后端基于Spring Boot框架,前端使用Vue3技术栈。整体架构分为三层:
┌─────────────────────────────────────────────────────────────┐
│ 前端应用 │
│ Vue 3 + TypeScript + Element Plus + Tailwind CSS │
└────────────────────────┬──────────────────────────────────────┘
│
│ WebSocket / HTTP
▼
┌─────────────────────────────────────────────────────────────┐
│ 后端服务层 │
│ Spring Boot 3.2.3 + WebSocket │
└────────────────────────┬──────────────────────────────────────┘
│
┌───────────────┼───────────────┐
▼ ▼ ▼
┌─────────────┐ ┌─────────────┐ ┌─────────────┐
│ ASR 服务 │ │ NLU 服务 │ │ TTS 服务 │
│ 语音识别 │ │ 自然语言理解 │ │ 语音合成 │
└─────────────┘ └─────────────┘ └─────────────┘
│ │ │
└───────────────┼───────────────┘
▼
┌─────────────────────────────────────────────────────────────┐
│ 数据存储层 │
│ MySQL 8.0 + Redis 6.0 │
└─────────────────────────────────────────────────────────────┘
前端层
前端负责用户交互和语音采集,主要技术包括:
- Vue3 + TypeScript:现代化的前端框架,提供良好的开发体验
- Element Plus:UI组件库,快速构建美观的界面
- Web Audio API:浏览器原生音频处理能力,实现录音和音量检测
- Pinia:状态管理,管理应用全局状态
前端通过MediaRecorder和AudioContext采集用户语音,实时显示音量波形,提供友好的交互反馈。
后端层
后端是系统的核心,集成了多个AI能力:
- 语音识别(ASR):集成Qwen3-ASR服务,将语音转换为文本
- 自然语言理解(NLU):基于大语言模型,理解用户意图并提取关键信息
- 语音合成(TTS):将文本转换为语音,提供语音反馈
- 规则引擎:自定义字段校验规则,确保数据准确性
后端采用管道式处理流程,将语音输入逐步转换为结构化的表单数据。
数据层
数据层负责存储和管理系统数据:
- 表单模板:存储各种表单的模板定义,包括字段、规则、校验逻辑
- 表单数据:存储用户填写的表单记录
- 主数据:存储业务基础数据,如供应商、商品等
核心功能实现
1. 语音唤醒
语音唤醒是用户进入系统的入口。用户只需说出"开始填单"、"帮我填单"等唤醒词,系统就能识别并启动填单流程。
实现思路:
- 前端持续监听用户语音,实时检测音量变化
- 当检测到有效语音输入后,发送到后端进行识别
- 后端识别文本后,匹配预设的唤醒词
- 匹配成功后,自动跳转到表单填写页面
为了提升用户体验,我们设计了两种状态提示:
- "正在聆听...":表示系统正在等待用户说话
- "正在识别中...":表示系统正在处理识别到的语音
2. 语音识别
语音识别是整个系统的基础。我们采用了本地录音+云端识别的方案:
- 前端使用Web Audio API采集音频,采样率设置为16kHz,单声道
- 音频数据编码为WAV格式后,发送到后端ASR服务
- 后端调用Qwen3-ASR接口进行语音识别
- 识别结果返回给前端进行后续处理
这种方案的优势是:
- 不依赖浏览器的语音识别API,避免网络限制问题
- 可以使用更强大的云端ASR服务,识别准确率更高
- 支持自定义语言参数,确保识别结果的准确性
3. 语义理解
语义理解是系统的核心能力。用户说话时,不会严格按照表单字段的顺序,而是用自然语言描述填写内容。系统需要理解这些自然语言,提取出关键信息。
实现思路:
- 使用大语言模型(LLM)进行语义分析
- 通过Prompt Engineering引导模型理解任务目标
- 模型输出结构化的JSON数据,包含字段名和对应值
- 后端解析JSON数据,映射到表单字段
例如,用户说"采购100台联想笔记本电脑,单价5000元",系统能够自动识别出:
- 商品名称:联想笔记本电脑
- 数量:100
- 单价:5000元
4. 智能校验
表单填写完成后,系统会进行智能校验,确保数据的完整性和合法性。
校验类型:
- 必填项检查:确保所有必填字段都已填写
- 数据格式检查:如日期格式、数字范围等
- 业务规则检查:如采购金额是否超出预算
- 逻辑一致性检查:如开始日期不能晚于结束日期
校验结果会以友好的方式反馈给用户,指出需要修改的地方。
5. 语音反馈
为了让用户确认填写内容的准确性,系统提供了语音回读功能。
实现思路:
- 将填写好的表单数据转换为自然语言描述
- 调用TTS服务将文本转换为语音
- 前端播放语音,用户可以确认信息是否正确
例如,系统会播报:"您填写的是采购入库单,商品为联想笔记本电脑,数量100台,单价5000元,总金额50万元,供应商为XX公司。"
效果展示





技术亮点
1. 端到端语音处理
系统实现了从语音采集到表单填写的完整流程,用户无需任何手动操作,真正实现了"说话即填单"。
2. 智能语义理解
利用大语言模型的强大能力,系统能够理解复杂的自然语言表达,即使说话顺序不固定,也能准确提取信息。
3. 实时反馈机制
系统提供了丰富的实时反馈,包括音量波形、识别状态、校验结果等,让用户随时了解系统状态。
4. 灵活的模板配置
系统支持动态配置表单模板,管理员可以轻松添加新的表单类型,无需修改代码。
5. 多模态交互
系统支持语音和文本两种输入方式,用户可以根据场景选择最合适的交互方式。
应用场景
AI语音填单系统可以应用于多种场景:
- 企业办公:采购申请、费用报销、请假申请等
- 仓储物流:入库单、出库单、质检单等
- 医疗健康:病历填写、处方开具等
- 政务服务:各类申请表、登记表等
总结
AI语音填单系统将语音识别、自然语言理解、语音合成等AI技术深度融合,为传统表单填写场景带来了全新的体验。通过智能化的语音交互,大幅提升了工作效率,降低了操作门槛。
随着AI技术的不断发展,我们有理由相信,语音交互将成为未来人机交互的主流方式。AI语音填单系统只是这个趋势的一个缩影,未来会有更多类似的智能应用出现,让我们的生活和工作变得更加便捷。