5.1 培养品味:用AI为业务提效
RIDE方法论
在业务中应用AI的四个阶段框架:
| 阶段 | 英文 | 中文 | 核心内容 |
|---|---|---|---|
| R | Research | 选方向 | 选择合适的业务场景 |
| I | Identify | 定标准 | 确立衡量标准和评估方法 |
| D | Drive | 推落地 | 推动AI在业务中实际落地 |
| E | Evaluate | 验效果 | 验证AI应用的实际效果 |
"品味"的定义
不仅要有搭建AI系统的技术能力,还需要具备选方向、定标准、验效果的判断力——即"品味"。
5.2 总结与展望
一、课程五阶段回顾
| 阶段 | 核心内容 | 引出下一步的问题 |
|---|---|---|
| 第一阶段 | 让机器人开口说话,算清第一笔账 | 回答质量不可控 |
| 第二阶段 | 给知识、教规范、建评测,让回答质量可衡量 | 只能问答不能行动 |
| 第三阶段 | Agent能动手、会规划、懂分工、给记忆和方法论 | 系统未投产 |
| 第四阶段 | 解决成本、部署、安全问题,走向生产 | 缺乏业务视角 |
| 第五阶段 | RIDE方法论,建立业务视角评估判断力 | -- |
核心思维:先让它能用 → 再让它好用 → 然后让它可靠 → 最后让它上线
二、五类AI应用场景
| 场景 | 技术 | 要点 |
|---|---|---|
| 多模态数据信息提取 | 视觉理解大模型 | 商品图片打标、表单提取、视频理解 |
| AI剧本生成与动画创作 | 多智能体工作流 | 用户设计角色和剧情,AI自主完成创作 |
| 10分钟构建AI智能助手 | 百炼平台 | 网页客服/钉钉群/公众号/企微,零代码 |
| 与AI实时音视频通话 | 视频云ARTC | 低延迟实时交互,支持音视频 |
| 与AI程序员结伴编程 | 灵码 | 生成→测试→修复→批量修改,全栈联调 |
三、AI影响千行百业
医疗
- 大模型生成药品不良反应报告
- 达摩院"达医智影":CT影像诊断,20秒出结果,准确率96%+
- 肺部疾病筛查效率:几小时 → 数分钟
- ⚠️ AI建议仅作辅助,医疗决策应由专业医生综合判断
娱乐
- 虚拟偶像"厘里":AI深度驱动虚拟人
- 数字人技术:虚拟主播、数字员工
教育
- 精准学 × 千问大模型:AI一对一老师
- 根据学习进度和薄弱环节自动调整内容与难度
四、深度思考模型 QwQ(扩展)
- 基于 Qwen2.5 系列训练的强推理能力模型
- 商业版(qwq-plus):强化学习提升数学/代码/通用任务性能
- 开源版(qwq-32b):超越同类蒸馏模型
- 超长上下文:131,072 tokens
- 限制:不支持工具调用、结构化输出
- 定位:需要深度思考与高质量回复的场景
五、认证路径
- 模拟考试 → 阿里云大模型ACP认证考试(ACP26)
全课程核心知识图谱
大模型ACP认证
├── C1 环境准备
│ └── PAI-DSW / API Key配置
│
├── C2 构造问答系统(上下文工程)
│ ├── 2.1 大模型基础
│ │ ├── API调用(OpenAI SDK)
│ │ ├── 多轮对话(消息历史维护/持久化存储)
│ │ ├── 流式输出(stream=True)
│ │ ├── 工作原理(分词→向量化→推理→解码→自回归)
│ │ ├── 解码策略(确定性vs随机采样)
│ │ └── 随机性参数(temperature/top_p/top_k/seed/enable_search)
│ │
│ ├── 2.2 RAG基础
│ │ ├── 建立索引(解析→分段→向量化→存储)
│ │ ├── 检索生成(相似度检索→提示词模板→大模型)
│ │ ├── 多轮对话(问题改写/CondenseQuestionChatEngine)
│ │ └── LlamaIndex框架
│ │
│ ├── 2.3 提示词工程
│ │ ├── 六要素框架(目标/上下文/角色/受众/样例/格式)
│ │ ├── 技巧:分隔符/角色受众/输出格式/少样本/COT/ToT/GoT
│ │ ├── Meta Prompting(Critic-Optimizer-Grader 架构)
│ │ ├── AI裁判(训练集/评估集 7:3 + 过拟合检测 + 样本质量)
│ │ ├── 推理模型技巧(迭代调整/混合分工策略)
│ │ └── 工程化实践(可配置提示词/百炼可视化构建)
│ │
│ ├── 2.4 自动化评测
│ │ ├── Lost in the Middle + 知识浓度
│ │ ├── 四大评测维度(召回/忠实度/相关性/利用率)
│ │ ├── Ragas指标(Answer Correctness/Context Recall/Precision/Faithfulness/Answer Relevancy)
│ │ ├── 评测先行(避免盲目优化/量化效果/防止跷跷板效应)
│ │ ├── 自定义评测框架(流程可操作性/政策合规性/情绪安抚度)
│ │ └── 更多指标(ToolCallAccuracy/DataCompyScore/LLMSQLEquivalence/BleuScore)
│ │
│ └── 2.5 RAG优化
│ ├── 文档准备(意图空间vs知识空间)
│ ├── 解析与切片(5种切片方法/句子窗口核心矛盾)
│ ├── 向量化与存储(Embedding模型/向量数据库选择)
│ ├── 检索召回优化(改写/扩写/HyDE/标签/Rerank/滑动窗口)
│ ├── 生成阶段优化(模型选择/提示词/参数调优)
│ ├── 模块化RAG(不同问题路由到不同RAG应用)
│ └── GraphRAG(RAG + QFS 结合)
│
├── C3 构建Agent系统
│ ├── 3.1 工具调用(Function Calling/ReAct/MCP)
│ │ ├── 结构化输出闭环(引导-校验-重试)
│ │ ├── MCP解耦原则(谁提供工具谁定义)
│ │ └── 手动实现的三个理由(原理/自定义/兼容性)
│ ├── 3.2 规划与执行
│ │ ├── 反思(自我vs外部/审查者不改写原则/LLM幻觉三种类型)
│ │ ├── 单Agent失败原因(注意力稀释/错误级联/扁平化vs结构化)
│ │ ├── 工作流五模式(Pipeline/Branching/Parallel/MoA多层/HITL)
│ │ ├── Browser Use案例(感知-规划-行动循环)
│ │ └── 自主规划(Plan&Execute/Code as Action/探索-固化混合)
│ ├── 3.3 多Agent协作(分层/共创/混合/从现实学习方法论)
│ ├── 3.4 记忆机制
│ │ ├── Lost in the Middle效应
│ │ ├── 三种策略(窗口截断/滚动摘要/向量化召回)
│ │ ├── 主动记忆管理(static_control/agent_control)
│ │ └── 框架推荐(AgentScope/Mem0/LangChain/百炼)
│ ├── 3.5 Skill
│ │ ├── Skill vs RAG区别(程序性知识vs陈述性知识)
│ │ ├── 五步编写法 + Template/Examples模式
│ │ ├── 工作流设计模式(检查清单/反馈循环/高风险操作)
│ │ ├── 社区Skill市场 + 生命周期管理
│ │ └── 团队协作(Skills-as-Code/种子策略/治理演进)
│ ├── 3.6 评测驱动
│ │ ├── 迭代式确立评测标准
│ │ ├── LLM-as-Judge四种偏见(+位置偏见)
│ │ ├── 业务专家作为评测Owner
│ │ └── Skill测试集构建
│ └── 3.7 Qwen Code
│ ├── EPCC工作流 + 审查清单
│ ├── QWEN.md + 面向失败写记忆
│ ├── Harness Engineering(Hooks机制)
│ └── 擅长/容易出错 + 五反模式
│
├── C4 交付上线
│ ├── 4.1 蒸馏降本
│ │ ├── 蒸馏vs微调(暗知识/软标签/数据合成三条路径)
│ │ ├── 适合/不适合蒸馏的场景(+替代方案表)
│ │ ├── LoRA微调(损失函数/梯度下降/训练状态/常见问题表)
│ │ ├── 评测指标(JSON合规率/intents F1/route准确率/语义正确vs字符串匹配)
│ │ └── 成本分析(盈亏平衡点/混合架构)
│ ├── 4.2 模型部署(vLLM/云上方案/DeepGPU-LLM/端云协同/嵌入式)
│ ├── 4.3 生产实践
│ │ ├── 业务需求分析(功能性/非功能性)
│ │ ├── 性能优化(GPU必要性/max_tokens设计哲学/三种并行化/错误处理三原则)
│ │ ├── 成本优化(GPU实例计算方法/抢占式实例)
│ │ ├── 稳定性(评测基线四法/容灾演练)
│ │ └── 可观测性(ARMS/指标阈值表/PD分离/MLOps)
│ └── 4.4 安全合规
│ ├── 攻击类型(提示词注入vs指令注入/16种具体案例/法律后果)
│ ├── 关键词过滤三大局限
│ ├── 五层纵深防御(大模型安全三要素/远程证明/异构机密计算/知识库访问控制/向量加密原因)
│ └── 合规(6个国家/地区法规)
│
└── C5 总结与展望
├── RIDE方法论(选方向/定标准/推落地/验效果)
└── 五类AI应用场景 + 行业案例