总结与展望

5.1 培养品味:用AI为业务提效

RIDE方法论

在业务中应用AI的四个阶段框架:

阶段 英文 中文 核心内容
R Research 选方向 选择合适的业务场景
I Identify 定标准 确立衡量标准和评估方法
D Drive 推落地 推动AI在业务中实际落地
E Evaluate 验效果 验证AI应用的实际效果

"品味"的定义

不仅要有搭建AI系统的技术能力,还需要具备选方向、定标准、验效果的判断力——即"品味"。


5.2 总结与展望

一、课程五阶段回顾

阶段 核心内容 引出下一步的问题
第一阶段 让机器人开口说话,算清第一笔账 回答质量不可控
第二阶段 给知识、教规范、建评测,让回答质量可衡量 只能问答不能行动
第三阶段 Agent能动手、会规划、懂分工、给记忆和方法论 系统未投产
第四阶段 解决成本、部署、安全问题,走向生产 缺乏业务视角
第五阶段 RIDE方法论,建立业务视角评估判断力 --

核心思维:先让它能用 → 再让它好用 → 然后让它可靠 → 最后让它上线

二、五类AI应用场景

场景 技术 要点
多模态数据信息提取 视觉理解大模型 商品图片打标、表单提取、视频理解
AI剧本生成与动画创作 多智能体工作流 用户设计角色和剧情,AI自主完成创作
10分钟构建AI智能助手 百炼平台 网页客服/钉钉群/公众号/企微,零代码
与AI实时音视频通话 视频云ARTC 低延迟实时交互,支持音视频
与AI程序员结伴编程 灵码 生成→测试→修复→批量修改,全栈联调

三、AI影响千行百业

医疗

  • 大模型生成药品不良反应报告
  • 达摩院"达医智影":CT影像诊断,20秒出结果,准确率96%+
  • 肺部疾病筛查效率:几小时 → 数分钟
  • ⚠️ AI建议仅作辅助,医疗决策应由专业医生综合判断

娱乐

  • 虚拟偶像"厘里":AI深度驱动虚拟人
  • 数字人技术:虚拟主播、数字员工

教育

  • 精准学 × 千问大模型:AI一对一老师
  • 根据学习进度和薄弱环节自动调整内容与难度

四、深度思考模型 QwQ(扩展)

  • 基于 Qwen2.5 系列训练的强推理能力模型
  • 商业版(qwq-plus):强化学习提升数学/代码/通用任务性能
  • 开源版(qwq-32b):超越同类蒸馏模型
  • 超长上下文:131,072 tokens
  • 限制:不支持工具调用、结构化输出
  • 定位:需要深度思考与高质量回复的场景

五、认证路径

  • 模拟考试 → 阿里云大模型ACP认证考试(ACP26)

全课程核心知识图谱

大模型ACP认证
├── C1 环境准备
│   └── PAI-DSW / API Key配置
│
├── C2 构造问答系统(上下文工程)
│   ├── 2.1 大模型基础
│   │   ├── API调用(OpenAI SDK)
│   │   ├── 多轮对话(消息历史维护/持久化存储)
│   │   ├── 流式输出(stream=True)
│   │   ├── 工作原理(分词→向量化→推理→解码→自回归)
│   │   ├── 解码策略(确定性vs随机采样)
│   │   └── 随机性参数(temperature/top_p/top_k/seed/enable_search)
│   │
│   ├── 2.2 RAG基础
│   │   ├── 建立索引(解析→分段→向量化→存储)
│   │   ├── 检索生成(相似度检索→提示词模板→大模型)
│   │   ├── 多轮对话(问题改写/CondenseQuestionChatEngine)
│   │   └── LlamaIndex框架
│   │
│   ├── 2.3 提示词工程
│   │   ├── 六要素框架(目标/上下文/角色/受众/样例/格式)
│   │   ├── 技巧:分隔符/角色受众/输出格式/少样本/COT/ToT/GoT
│   │   ├── Meta Prompting(Critic-Optimizer-Grader 架构)
│   │   ├── AI裁判(训练集/评估集 7:3 + 过拟合检测 + 样本质量)
│   │   ├── 推理模型技巧(迭代调整/混合分工策略)
│   │   └── 工程化实践(可配置提示词/百炼可视化构建)
│   │
│   ├── 2.4 自动化评测
│   │   ├── Lost in the Middle + 知识浓度
│   │   ├── 四大评测维度(召回/忠实度/相关性/利用率)
│   │   ├── Ragas指标(Answer Correctness/Context Recall/Precision/Faithfulness/Answer Relevancy)
│   │   ├── 评测先行(避免盲目优化/量化效果/防止跷跷板效应)
│   │   ├── 自定义评测框架(流程可操作性/政策合规性/情绪安抚度)
│   │   └── 更多指标(ToolCallAccuracy/DataCompyScore/LLMSQLEquivalence/BleuScore)
│   │
│   └── 2.5 RAG优化
│       ├── 文档准备(意图空间vs知识空间)
│       ├── 解析与切片(5种切片方法/句子窗口核心矛盾)
│       ├── 向量化与存储(Embedding模型/向量数据库选择)
│       ├── 检索召回优化(改写/扩写/HyDE/标签/Rerank/滑动窗口)
│       ├── 生成阶段优化(模型选择/提示词/参数调优)
│       ├── 模块化RAG(不同问题路由到不同RAG应用)
│       └── GraphRAG(RAG + QFS 结合)
│
├── C3 构建Agent系统
│   ├── 3.1 工具调用(Function Calling/ReAct/MCP)
│   │   ├── 结构化输出闭环(引导-校验-重试)
│   │   ├── MCP解耦原则(谁提供工具谁定义)
│   │   └── 手动实现的三个理由(原理/自定义/兼容性)
│   ├── 3.2 规划与执行
│   │   ├── 反思(自我vs外部/审查者不改写原则/LLM幻觉三种类型)
│   │   ├── 单Agent失败原因(注意力稀释/错误级联/扁平化vs结构化)
│   │   ├── 工作流五模式(Pipeline/Branching/Parallel/MoA多层/HITL)
│   │   ├── Browser Use案例(感知-规划-行动循环)
│   │   └── 自主规划(Plan&Execute/Code as Action/探索-固化混合)
│   ├── 3.3 多Agent协作(分层/共创/混合/从现实学习方法论)
│   ├── 3.4 记忆机制
│   │   ├── Lost in the Middle效应
│   │   ├── 三种策略(窗口截断/滚动摘要/向量化召回)
│   │   ├── 主动记忆管理(static_control/agent_control)
│   │   └── 框架推荐(AgentScope/Mem0/LangChain/百炼)
│   ├── 3.5 Skill
│   │   ├── Skill vs RAG区别(程序性知识vs陈述性知识)
│   │   ├── 五步编写法 + Template/Examples模式
│   │   ├── 工作流设计模式(检查清单/反馈循环/高风险操作)
│   │   ├── 社区Skill市场 + 生命周期管理
│   │   └── 团队协作(Skills-as-Code/种子策略/治理演进)
│   ├── 3.6 评测驱动
│   │   ├── 迭代式确立评测标准
│   │   ├── LLM-as-Judge四种偏见(+位置偏见)
│   │   ├── 业务专家作为评测Owner
│   │   └── Skill测试集构建
│   └── 3.7 Qwen Code
│       ├── EPCC工作流 + 审查清单
│       ├── QWEN.md + 面向失败写记忆
│       ├── Harness Engineering(Hooks机制)
│       └── 擅长/容易出错 + 五反模式
│
├── C4 交付上线
│   ├── 4.1 蒸馏降本
│   │   ├── 蒸馏vs微调(暗知识/软标签/数据合成三条路径)
│   │   ├── 适合/不适合蒸馏的场景(+替代方案表)
│   │   ├── LoRA微调(损失函数/梯度下降/训练状态/常见问题表)
│   │   ├── 评测指标(JSON合规率/intents F1/route准确率/语义正确vs字符串匹配)
│   │   └── 成本分析(盈亏平衡点/混合架构)
│   ├── 4.2 模型部署(vLLM/云上方案/DeepGPU-LLM/端云协同/嵌入式)
│   ├── 4.3 生产实践
│   │   ├── 业务需求分析(功能性/非功能性)
│   │   ├── 性能优化(GPU必要性/max_tokens设计哲学/三种并行化/错误处理三原则)
│   │   ├── 成本优化(GPU实例计算方法/抢占式实例)
│   │   ├── 稳定性(评测基线四法/容灾演练)
│   │   └── 可观测性(ARMS/指标阈值表/PD分离/MLOps)
│   └── 4.4 安全合规
│       ├── 攻击类型(提示词注入vs指令注入/16种具体案例/法律后果)
│       ├── 关键词过滤三大局限
│       ├── 五层纵深防御(大模型安全三要素/远程证明/异构机密计算/知识库访问控制/向量加密原因)
│       └── 合规(6个国家/地区法规)
│
└── C5 总结与展望
    ├── RIDE方法论(选方向/定标准/推落地/验效果)
    └── 五类AI应用场景 + 行业案例
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容