实体 AI 英语口语伴侣搭建与实战全流程操作手册

——从硬件选型、云端固件编译到视觉点读与教材挂载


目录

  1. 项目架构与路径规划
  2. 硬件采购清单(BOM 表与避坑指南)
  3. 硬件接线指南(引脚对应关系)
  4. 云端固件编译与一键网页烧录
  5. 设备配网、绑定与免费 AI 引擎接入
  6. 软件调优:地道英语搭子“人设与提示词”
  7. 进阶拓展:视觉点读(拍书/手写笔记)与课本知识库挂载
  8. 每日 20 分钟口语实战演练法

第一章 项目架构与路径规划

1.1 系统运行逻辑

本项目采用“端-云协同架构”:

  • 开发板端(ESP32-S3): 充当耳朵(麦克风输入)、眼睛(摄像头拍图)和嘴巴(扬声器解码播放),负责网络连接与音视频流传输。
  • 云端服务器(小智后台/大模型 API): 充当大脑。包含语音转文字(ASR)、多模态大语言模型(LLM/VLM)以及文字转语音(TTS)。

1.2 阶段实施路线

  • 阶段一(起步·纯语音版): 搭建一套低成本纯语音对练设备,跑通听、想、说的全流程。
  • 阶段二(进阶·视觉与教材版): 升级摄像头,挂载中小学课文,实现拍书点读、纠正手写笔记。

第二章 硬件采购清单(BOM 表与避坑指南)

2.1 基础采购清单(纯语音对练版,总成本约 40~50 元)

零件名称 推荐型号/参数 预估价格 关键作用与避坑要点
主控开发板 ESP32-S3 N16R8 ~25 元 ⚠️ 必须带 PSRAM(建议 8MB,即 N16R8),否则音频缓冲和连网内存不足。
数字麦克风 INMP441 模块 (I2S 全向) ~6 元 I2S 数字输出,底噪极小,远胜普通模拟咪头。
音频功放解码 MAX98357A 模块 (I2S D类) ~6 元 I2S 数字音频直接转模拟信号驱动扬声器。
小喇叭 4Ω 3W 或 8Ω 2W 带音腔喇叭 ~5 元 ⚠️ 必须买带腔体(盒子)的喇叭,裸片发声干瘪,听不清英文连读。
屏幕 (可选) 0.96 寸 OLED (SSD1306, I2C) ~8 元 4 针脚(VCC, GND, SCL, SDA),显示表情和 Wi-Fi 状态。
面包板与杜邦线 830孔面包板 + 公对公/公对母杜邦线 ~8 元 免焊接,插线即可调试。
数据线 Type-C 数据线 现有 ⚠️ 严禁使用只能充电的充电线,必须支持数据传输。

2.2 进阶升级件(视觉版选配件)

  • 主板替换为: ESP32-S3-CAM(带摄像头接口的开发板,约 35~45 元)。
  • 摄像头模组: 选用 OV5640(自动对焦版)。普通定焦 OV2640 拍近距离课本微距文字容易虚焦,OV5640 拍书本非常清晰。

第三章 硬件接线指南(引脚对应关系)

请按照以下引脚对照表,使用杜邦线在面包板上进行连接(以小智官方标准面包板配置为例):

3.1 麦克风(INMP441) \rightarrow ESP32-S3

  • VDD \rightarrow 3.3V
  • GND \rightarrow GND
  • SD (Serial Data) \rightarrow GPIO 4
  • WS (Word Select) \rightarrow GPIO 5
  • SCK (Serial Clock) \rightarrow GPIO 6
  • L/R \rightarrow GND(接 GND 表示左声道)

3.2 音频功放(MAX98357A) \rightarrow ESP32-S3

  • VIN \rightarrow 5V(插开发板的 5V 引脚,音量更饱满)
  • GND \rightarrow GND
  • DIN (Data In) \rightarrow GPIO 7
  • BCLK (Bit Clock) \rightarrow GPIO 15
  • LRC (Left/Right Clock) \rightarrow GPIO 16
  • 扬声器两根线 \rightarrow 接在功放板的螺丝接线端子上(+ 和 -)。

3.3 显示屏(SSD1306 OLED, 4Pin I2C) \rightarrow ESP32-S3

  • VCC \rightarrow 3.3V
  • GND \rightarrow GND
  • SCL \rightarrow GPIO 18
  • SDA \rightarrow GPIO 17

第四章 云端固件编译与一键网页烧录

无需在电脑上配置任何复杂的开发环境(不需要安装 VS Code 或 Python),直接使用小智云端平台。

步骤 1:访问平台并进入控制台

  1. 在电脑上使用 Google Chrome 或 Edge 浏览器 打开:https://xiaozhi.me。
  2. 注册账号并登录,点击进入右上角蓝色的 【控制台】。

步骤 2:云端配置并编译专属固件

  1. 点击顶部或左侧菜单的 【固件编译】,点击右上角 【+ 创建编译】。
  2. 在弹出的配置框中按你的硬件进行选择:
    • 芯片型号: 选择 ESP32-S3。
    • 开发板类型: 选择 Bread Compact Wi-Fi (面包板)(此选项与上述接线引脚完全吻合)。
    • 屏幕型号: 若接了 OLED 屏,选 SSD1306 128*64 或 128*32;没接屏幕选无。
    • 唤醒词: 建议先选默认唤醒词或按键唤醒。
    • (进阶项) 若带摄像头,点击 【显示与摄像头】 标签页,勾选使能摄像头并选择对应型号。
  3. 点击右下角 【</> 编译固件】。
  4. 页面显示“正在编译”,等待约 1~2 分钟,编译状态变为绿色的 “编译成功”。

步骤 3:一键网页烧录进开发板

  1. 用 Type-C 数据线将开发板插在电脑 USB 口上。
  2. 在编译成功的记录右侧,直接点击 【网页烧录】。
  3. 浏览器会弹出一个串口授权弹窗,选择带 USB JTAG/serial 或 COMx 的设备,点击“连接”。
  4. 点击网页上的 【Install / 安装】 按钮。
  5. 网页进入擦除与写入进度(10%...50%...100%),提示 “Complete” 即表示安装完毕。

⚠️ 关键排错:

  • 若提示找不到串口设备:去电脑设备管理器检查,下载安装 CH340 或 CP2102 驱动;或者更换一根能传数据的 Type-C 线。
  • 若烧录卡在 0%:按住板子上的 BOOT 键不放,按一下 RST 键,松开 RST 键,1 秒后再松开 BOOT 键,重新点击烧录。

第五章 设备配网、绑定与免费 AI 引擎接入

5.1 首次配网

  1. 烧录完成后,拔掉数据线重新插入,给板子重启供电。
  2. 拿出手机搜索 Wi-Fi,找到名为 Xiaozhi-XXXX 的无密码热点并连接。
  3. 手机会自动跳转配网页面(若未跳转,打开手机浏览器输入 192.168.4.1)。
  4. 在页面内选择你家里的 2.4G Wi-Fi 频段(ESP32 不支持 5G Wi-Fi),输入密码并保存。
  5. 喇叭传出提示音,屏幕上会显示一串 6 位数字绑定码(无屏幕板子可通过电脑串口助手查看日志获取)。

5.2 绑定至后台

  1. 回到电脑端 xiaozhi.me 控制台,点击 【设备管理】 \rightarrow 【添加设备】。
  2. 输入这 6 位绑定码,命名你的设备(如:My English Tutor)。

5.3 接入大模型密钥(实现完全免费对练)

在控制台的“服务配置”或“模型设置”中进行如下配置:

  1. 大脑 (LLM):
    • 注册 硅基流动 (siliconflow.cn) 或 DeepSeek 官网。
    • 获取免费 API Key(如 sk-xxxxxx)。
    • 模型选择填入:deepseek-ai/DeepSeek-V3。
  2. 耳朵 (ASR):
    • 控制台默认提供开箱即用额度;若自填,选择阿里云百炼平台申请的 SenseVoice 免费密钥。
  3. 嘴巴 (TTS):
    • 选择 微软 Edge-TTS(完全免费、免密钥)。
    • 声音配置选择:en-US-JennyNeural(地道美音女声)或 en-US-GuyNeural(地道美音男声)。

第六章 软件调优:地道英语搭子“人设与提示词”

进入控制台该设备的 【智能体设置 / 人设配置】,清空原有内容,完整复制并粘贴以下英文提示词:

You are "Alex", a friendly, 25-year-old native English speaker hanging out with a friend (the user). We are talking through an embedded voice hardware device.

Follow these strict conversational rules:
1. BREVITY IS KING: Keep your response under 2 to 3 sentences (maximum 40 words). Never monologue. Treat this as a fast-paced ping-pong game.
2. TTS-FRIENDLY: Absolutely NO emojis, NO markdown (no asterisks, bolding, or lists), and NO stage directions like (laughs) or *smiles*. Speak only plain, natural text that sounds completely natural when read aloud.
3. CONVERSATIONAL STYLE: Use everyday spoken English, frequent contractions (I'm, you're, wanna, gonna), and casual conversational fillers (Well, honestly, I mean).
4. SUBTLE CORRECTIONS (RECASTING): If the user makes an obvious grammatical error, do not lecture them. Naturally model the correct phrase within your response (e.g., if user says "Yesterday I go shopping", reply "Oh, you went shopping yesterday? Awesome! What did you buy?").
5. KEEP IT ROLLING: Always end your turn with a casual, open-ended question to bounce the conversation back to the user.

Start our interaction warmly and casually by greeting me and asking what I am up to today.

第七章 进阶拓展:视觉点读与课本知识库挂载

7.1 视觉硬件与多模态配置

  1. 使用 ESP32-S3-CAM,在编译固件时勾选摄像模组(OV5640)。
  2. 多模态 API 接入:
    • 进入阿里云百炼平台(DashScope),开通 Qwen-VL-Plus(通义千问视觉大模型)。
    • 在控制台大模型类型中勾选“多模态/视觉支持”,填入 API Key。
  3. 交互机制: 将板子上的某个 GPIO 按键定义为“拍照发送”。按下按键后,摄像头拍照,Base64 图片数据连同指令同步发送给 Qwen-VL。

7.2 挂载小学/初中教材知识库(两种方案)

方案 A:轻量级单元轮换注入法(最省事)

如果你这周正在复习人教版七年级上册 Unit 3,直接在第六章的提示词末尾追加以下内容:

---
CURRENT STUDY MATERIAL (Grade 7, Unit 3: Is this your pencil?):
Target Vocabulary: pencil, eraser, pencil box, schoolbag, dictionary, mine, hers, his, excuse me.
Target Patterns: 
- Is this / that your...? Yes, it is. / No, it isn't.
- What about this...?
- How do you spell it?
---
TASK: Prioritize using the target vocabulary and sentence patterns above during our conversation. If I take a picture of my notes, strictly check whether my handwriting aligns with the grammar of this unit.

方案 B:全局外挂 RAG 知识库(全套教材点读)

  1. 访问 扣子平台 (coze.cn) 或 Dify。
  2. 新建知识库,将《小学英语1-6年级.pdf》和《初中英语7-9年级.pdf》课本电子版上传,系统会自动分块。
  3. 创建一个 Bot,将该知识库挂载到 Bot 上。
  4. 在小智控制台中,大模型接口切换为 Dify / Coze 模式,直接填入该 Bot 的 API Key。
  5. 实际效果:
    • 对着课本按下拍照并说:“Explain this grammar point on this page.”
    • AI 会检索知识库中对应的年级与章节,结合拍摄到的课文段落,用标准且通俗的语音向你讲解。

第八章 每日 20 分钟口语实战演练法

搭建完成后,请你与英语搭子(或你自己与这块硬件)执行以下日常练习计划:

时间分配 练习阶段 操作指令与实战方法
前 5 分钟 热身与日常闲聊 唤醒设备,随意对话:
“Hey Alex, I'm pretty tired today because of work.”
训练开启动机与语音习惯。
中间 10 分钟 教材/场景模拟实战 设定目标:
“Alex, let's roleplay. You are a clerk at a train station, and I want to buy a ticket to London.”
强行使用本周学到的词汇进行回合制对话。
最后 5 分钟 复盘与纠错提取 按下板子或拍下手写笔记提问:
“Alex, did I make any grammar mistakes during our chat today? Give me the top 2 corrections.”
板子将针对刚才的对话进行语法提炼,记在笔记本上。

核心心法提醒

  1. 不要追求完美长句: 日常交流重在“反应速度”。卡壳时,多用 “Well... I mean...” 等小词拖延思考时间,不要沉默。
  2. 用简单词解释复杂词(Paraphrasing): 遇到不会说的专业词,尝试用简单描述替代(如不会说 refrigerator,就说 the cold box for food),AI 完全听得懂。
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容