MediaPipe 是 Google 开源的跨平台、实时、端侧机器学习框架,主打视觉/音频/文本的流式处理,核心是模块化图执行+预训练模型+多端部署,让你在手机、网页、嵌入式设备上快速跑实时 AI 应用。
一、一句话定位
端侧实时 AI 的“乐高式”流水线:把图像/视频/音频处理拆成可插拔模块(Calculator),用数据流图(Graph)串起来,内置大量预训练模型,一次开发、多端部署,主打低延迟、轻量、实时。
二、核心架构(极简版)
-
MediaPipe Framework(底层引擎)
- Graph:定义数据流向与处理逻辑(类似流程图)。
- Calculator:最小执行单元(预处理、推理、后处理、渲染)。
- Packet:数据载体(图像、关键点、音频帧等),带时间戳保证同步。
-
MediaPipe Solutions(上层开箱即用)
- Tasks:封装好的 API(Python/JS/Java/C++),直接调用手势、人脸、姿态等功能。
- 预训练模型:轻量、端侧优化,无需自己训练即可用。
- Model Maker:用自己数据微调模型。
- Studio:浏览器里可视化调试 pipeline。
三、核心能力与优势
-
跨平台全覆盖
- 支持:Android、iOS、Windows、macOS、Linux、Web(Wasm)、嵌入式/IoT。
- 一套逻辑,多端部署,大幅减少适配成本。
-
极致实时与性能
- 图调度+硬件加速(GPU、NPU、DSP),手机上也能跑30+ FPS。
- 模型量化/压缩,体积小、推理快。
-
开箱即用的主流能力
-
视觉(最常用)
- 手势识别:21个3D关键点,支持多指、手势分类。
- 人脸检测/人脸网格(FaceMesh):468个3D关键点,AR/美颜基础。
- 人体姿态(Pose):33个3D关键点,动作捕捉。
- 人像分割、物体检测、目标追踪、虹膜、头发分割等。
- 音频/文本:语音分类、文本分类、嵌入等。
-
视觉(最常用)
-
高度可定制
- 替换/新增 Calculator,接入自定义模型,灵活组合 pipeline。
四、典型应用场景
- 移动端 AR/VR:手势交互、人脸特效、虚拟试妆。
- 视频会议:虚拟背景、美颜、手势控制。
- 健身/运动:动作识别、姿态矫正。
- 智能交互:无接触控制、手语识别。
- 工业/安防:实时检测、行为分析。
五、一句话总结
MediaPipe = 端侧实时AI流水线 + 预训练模型库 + 跨平台部署引擎,是做手机/网页实时视觉AI的首选框架。
需要我给你一段Python 极简代码,用 MediaPipe 实现实时手势识别并在摄像头画面上画出手部关键点吗?