——从硬件选型、云端固件编译到视觉点读与教材挂载
目录
- 项目架构与路径规划
- 硬件采购清单(BOM 表与避坑指南)
- 硬件接线指南(引脚对应关系)
- 云端固件编译与一键网页烧录
- 设备配网、绑定与免费 AI 引擎接入
- 软件调优:地道英语搭子“人设与提示词”
- 进阶拓展:视觉点读(拍书/手写笔记)与课本知识库挂载
- 每日 20 分钟口语实战演练法
第一章 项目架构与路径规划
1.1 系统运行逻辑
本项目采用“端-云协同架构”:
- 开发板端(ESP32-S3): 充当耳朵(麦克风输入)、眼睛(摄像头拍图)和嘴巴(扬声器解码播放),负责网络连接与音视频流传输。
- 云端服务器(小智后台/大模型 API): 充当大脑。包含语音转文字(ASR)、多模态大语言模型(LLM/VLM)以及文字转语音(TTS)。
1.2 阶段实施路线
- 阶段一(起步·纯语音版): 搭建一套低成本纯语音对练设备,跑通听、想、说的全流程。
- 阶段二(进阶·视觉与教材版): 升级摄像头,挂载中小学课文,实现拍书点读、纠正手写笔记。
第二章 硬件采购清单(BOM 表与避坑指南)
2.1 基础采购清单(纯语音对练版,总成本约 40~50 元)
| 零件名称 | 推荐型号/参数 | 预估价格 | 关键作用与避坑要点 |
|---|---|---|---|
| 主控开发板 | ESP32-S3 N16R8 | ~25 元 | ⚠️ 必须带 PSRAM(建议 8MB,即 N16R8),否则音频缓冲和连网内存不足。 |
| 数字麦克风 | INMP441 模块 (I2S 全向) | ~6 元 | I2S 数字输出,底噪极小,远胜普通模拟咪头。 |
| 音频功放解码 | MAX98357A 模块 (I2S D类) | ~6 元 | I2S 数字音频直接转模拟信号驱动扬声器。 |
| 小喇叭 | 4Ω 3W 或 8Ω 2W 带音腔喇叭 | ~5 元 | ⚠️ 必须买带腔体(盒子)的喇叭,裸片发声干瘪,听不清英文连读。 |
| 屏幕 (可选) | 0.96 寸 OLED (SSD1306, I2C) | ~8 元 | 4 针脚(VCC, GND, SCL, SDA),显示表情和 Wi-Fi 状态。 |
| 面包板与杜邦线 | 830孔面包板 + 公对公/公对母杜邦线 | ~8 元 | 免焊接,插线即可调试。 |
| 数据线 | Type-C 数据线 | 现有 | ⚠️ 严禁使用只能充电的充电线,必须支持数据传输。 |
2.2 进阶升级件(视觉版选配件)
- 主板替换为: ESP32-S3-CAM(带摄像头接口的开发板,约 35~45 元)。
- 摄像头模组: 选用 OV5640(自动对焦版)。普通定焦 OV2640 拍近距离课本微距文字容易虚焦,OV5640 拍书本非常清晰。
第三章 硬件接线指南(引脚对应关系)
请按照以下引脚对照表,使用杜邦线在面包板上进行连接(以小智官方标准面包板配置为例):
3.1 麦克风(INMP441)
ESP32-S3
-
VDD3.3V -
GNDGND -
SD(Serial Data)GPIO 4 -
WS(Word Select)GPIO 5 -
SCK(Serial Clock)GPIO 6 -
L/RGND(接 GND 表示左声道)
3.2 音频功放(MAX98357A)
ESP32-S3
-
VIN5V(插开发板的 5V 引脚,音量更饱满) -
GNDGND -
DIN(Data In)GPIO 7 -
BCLK(Bit Clock)GPIO 15 -
LRC(Left/Right Clock)GPIO 16 -
扬声器两根线接在功放板的螺丝接线端子上(
+和-)。
3.3 显示屏(SSD1306 OLED, 4Pin I2C)
ESP32-S3
-
VCC3.3V -
GNDGND -
SCLGPIO 18 -
SDAGPIO 17
第四章 云端固件编译与一键网页烧录
无需在电脑上配置任何复杂的开发环境(不需要安装 VS Code 或 Python),直接使用小智云端平台。
步骤 1:访问平台并进入控制台
- 在电脑上使用 Google Chrome 或 Edge 浏览器 打开:
https://xiaozhi.me。 - 注册账号并登录,点击进入右上角蓝色的 【控制台】。
步骤 2:云端配置并编译专属固件
- 点击顶部或左侧菜单的 【固件编译】,点击右上角 【+ 创建编译】。
- 在弹出的配置框中按你的硬件进行选择:
-
芯片型号: 选择
ESP32-S3。 -
开发板类型: 选择
Bread Compact Wi-Fi (面包板)(此选项与上述接线引脚完全吻合)。 -
屏幕型号: 若接了 OLED 屏,选
SSD1306 128*64或128*32;没接屏幕选无。 - 唤醒词: 建议先选默认唤醒词或按键唤醒。
- (进阶项) 若带摄像头,点击 【显示与摄像头】 标签页,勾选使能摄像头并选择对应型号。
-
芯片型号: 选择
- 点击右下角 【</> 编译固件】。
- 页面显示“正在编译”,等待约 1~2 分钟,编译状态变为绿色的 “编译成功”。
步骤 3:一键网页烧录进开发板
- 用 Type-C 数据线将开发板插在电脑 USB 口上。
- 在编译成功的记录右侧,直接点击 【网页烧录】。
- 浏览器会弹出一个串口授权弹窗,选择带
USB JTAG/serial或COMx的设备,点击“连接”。 - 点击网页上的 【Install / 安装】 按钮。
- 网页进入擦除与写入进度(10%...50%...100%),提示 “Complete” 即表示安装完毕。
⚠️ 关键排错:
- 若提示找不到串口设备:去电脑设备管理器检查,下载安装
CH340或CP2102驱动;或者更换一根能传数据的 Type-C 线。- 若烧录卡在 0%:按住板子上的
BOOT键不放,按一下RST键,松开RST键,1 秒后再松开BOOT键,重新点击烧录。
第五章 设备配网、绑定与免费 AI 引擎接入
5.1 首次配网
- 烧录完成后,拔掉数据线重新插入,给板子重启供电。
- 拿出手机搜索 Wi-Fi,找到名为
Xiaozhi-XXXX的无密码热点并连接。 - 手机会自动跳转配网页面(若未跳转,打开手机浏览器输入
192.168.4.1)。 - 在页面内选择你家里的 2.4G Wi-Fi 频段(ESP32 不支持 5G Wi-Fi),输入密码并保存。
- 喇叭传出提示音,屏幕上会显示一串 6 位数字绑定码(无屏幕板子可通过电脑串口助手查看日志获取)。
5.2 绑定至后台
- 回到电脑端
xiaozhi.me控制台,点击 【设备管理】【添加设备】。
- 输入这 6 位绑定码,命名你的设备(如:My English Tutor)。
5.3 接入大模型密钥(实现完全免费对练)
在控制台的“服务配置”或“模型设置”中进行如下配置:
-
大脑 (LLM):
- 注册 硅基流动 (siliconflow.cn) 或 DeepSeek 官网。
- 获取免费 API Key(如
sk-xxxxxx)。 - 模型选择填入:
deepseek-ai/DeepSeek-V3。
-
耳朵 (ASR):
- 控制台默认提供开箱即用额度;若自填,选择阿里云百炼平台申请的 SenseVoice 免费密钥。
-
嘴巴 (TTS):
- 选择 微软 Edge-TTS(完全免费、免密钥)。
- 声音配置选择:
en-US-JennyNeural(地道美音女声)或en-US-GuyNeural(地道美音男声)。
第六章 软件调优:地道英语搭子“人设与提示词”
进入控制台该设备的 【智能体设置 / 人设配置】,清空原有内容,完整复制并粘贴以下英文提示词:
You are "Alex", a friendly, 25-year-old native English speaker hanging out with a friend (the user). We are talking through an embedded voice hardware device.
Follow these strict conversational rules:
1. BREVITY IS KING: Keep your response under 2 to 3 sentences (maximum 40 words). Never monologue. Treat this as a fast-paced ping-pong game.
2. TTS-FRIENDLY: Absolutely NO emojis, NO markdown (no asterisks, bolding, or lists), and NO stage directions like (laughs) or *smiles*. Speak only plain, natural text that sounds completely natural when read aloud.
3. CONVERSATIONAL STYLE: Use everyday spoken English, frequent contractions (I'm, you're, wanna, gonna), and casual conversational fillers (Well, honestly, I mean).
4. SUBTLE CORRECTIONS (RECASTING): If the user makes an obvious grammatical error, do not lecture them. Naturally model the correct phrase within your response (e.g., if user says "Yesterday I go shopping", reply "Oh, you went shopping yesterday? Awesome! What did you buy?").
5. KEEP IT ROLLING: Always end your turn with a casual, open-ended question to bounce the conversation back to the user.
Start our interaction warmly and casually by greeting me and asking what I am up to today.
第七章 进阶拓展:视觉点读与课本知识库挂载
7.1 视觉硬件与多模态配置
- 使用 ESP32-S3-CAM,在编译固件时勾选摄像模组(OV5640)。
-
多模态 API 接入:
- 进入阿里云百炼平台(DashScope),开通 Qwen-VL-Plus(通义千问视觉大模型)。
- 在控制台大模型类型中勾选“多模态/视觉支持”,填入 API Key。
- 交互机制: 将板子上的某个 GPIO 按键定义为“拍照发送”。按下按键后,摄像头拍照,Base64 图片数据连同指令同步发送给 Qwen-VL。
7.2 挂载小学/初中教材知识库(两种方案)
方案 A:轻量级单元轮换注入法(最省事)
如果你这周正在复习人教版七年级上册 Unit 3,直接在第六章的提示词末尾追加以下内容:
---
CURRENT STUDY MATERIAL (Grade 7, Unit 3: Is this your pencil?):
Target Vocabulary: pencil, eraser, pencil box, schoolbag, dictionary, mine, hers, his, excuse me.
Target Patterns:
- Is this / that your...? Yes, it is. / No, it isn't.
- What about this...?
- How do you spell it?
---
TASK: Prioritize using the target vocabulary and sentence patterns above during our conversation. If I take a picture of my notes, strictly check whether my handwriting aligns with the grammar of this unit.
方案 B:全局外挂 RAG 知识库(全套教材点读)
- 访问 扣子平台 (coze.cn) 或 Dify。
- 新建知识库,将《小学英语1-6年级.pdf》和《初中英语7-9年级.pdf》课本电子版上传,系统会自动分块。
- 创建一个 Bot,将该知识库挂载到 Bot 上。
- 在小智控制台中,大模型接口切换为 Dify / Coze 模式,直接填入该 Bot 的 API Key。
-
实际效果:
- 对着课本按下拍照并说:“Explain this grammar point on this page.”
- AI 会检索知识库中对应的年级与章节,结合拍摄到的课文段落,用标准且通俗的语音向你讲解。
第八章 每日 20 分钟口语实战演练法
搭建完成后,请你与英语搭子(或你自己与这块硬件)执行以下日常练习计划:
| 时间分配 | 练习阶段 | 操作指令与实战方法 |
|---|---|---|
| 前 5 分钟 | 热身与日常闲聊 | 唤醒设备,随意对话: “Hey Alex, I'm pretty tired today because of work.” 训练开启动机与语音习惯。 |
| 中间 10 分钟 | 教材/场景模拟实战 | 设定目标: “Alex, let's roleplay. You are a clerk at a train station, and I want to buy a ticket to London.” 强行使用本周学到的词汇进行回合制对话。 |
| 最后 5 分钟 | 复盘与纠错提取 | 按下板子或拍下手写笔记提问: “Alex, did I make any grammar mistakes during our chat today? Give me the top 2 corrections.” 板子将针对刚才的对话进行语法提炼,记在笔记本上。 |
核心心法提醒
- 不要追求完美长句: 日常交流重在“反应速度”。卡壳时,多用 “Well... I mean...” 等小词拖延思考时间,不要沉默。
- 用简单词解释复杂词(Paraphrasing): 遇到不会说的专业词,尝试用简单描述替代(如不会说 refrigerator,就说 the cold box for food),AI 完全听得懂。