核心知识脉络

阿里云大模型ACP认证 - 知识点提炼

📂 文件目录

文件 章节 核心主题
C1_课程准备_知识点.md C1 课程准备 PAI-DSW环境配置、API Key管理、GPU实例选择
C2_构造问答系统_知识点.md C2 构造问答系统 大模型原理、解码策略、RAG、提示词工程、AI裁判、评测、RAG优化、GraphRAG
C3_构建Agent系统_知识点.md C3 构建Agent系统 Function Calling、MCP、规划执行、多Agent、Memory、Skill、评测、Qwen Code
C4_交付上线_知识点.md C4 交付上线 蒸馏(暗知识/软标签)、LoRA微调、模型部署、生产实践(性能/成本/稳定性)、安全合规
C5_总结与展望_知识点.md C5 总结与展望 RIDE方法论、应用场景、行业案例、知识图谱

🔑 核心知识脉络

先让它能用 → 再让它好用 → 然后让它可靠 → 最后让它上线

第一阶段:让它能用(C1-C2.1)

  • 配置环境 → 调用API → 理解大模型工作原理 → 解码策略 → 随机性参数控制

第二阶段:让它好用(C2.2-C2.5)

  • RAG扩展知识 → 提示词工程引导行为 → AI裁判自动化优化 → 评测量化效果 → RAG检索优化 → GraphRAG/模块化RAG

第三阶段:让它可靠(C3)

  • 工具调用让Agent动手 → 规划执行让Agent思考 → 多Agent协作 → 记忆积累经验 → Skill固化流程 → 评测驱动开发

第四阶段:让它上线(C4)

  • 蒸馏降本(暗知识/三种路径) → 部署模型 → 生产实践(性能/成本/稳定性/可观测性)→ 安全合规(五层纵深防御)

第五阶段:让它有价值(C5)

  • RIDE方法论:选方向 → 定标准 → 推落地 → 验效果

⚡ 高频考点速记

大模型原理

  • 五阶段:分词 → 向量化 → 推理 → 解码自回归 → 输出
  • 解码策略:确定性解码(Greedy/Beam Search) vs 随机采样(Top-p/Top-k)
  • temperature 控制概率分布尖锐程度(低=确定,高=多样)
  • top_p 控制候选Token采样范围(低=稳定,高=多样)
  • 不建议同时调整 temperature 和 top_p

RAG

  • 建立索引:解析 → 分段 → 向量化 → 存储
  • 检索生成:问题向量化 → 相似度检索 → 提示词模板 → 大模型生成
  • 检索是最重要环节,检索不对生成一定出错
  • 多轮对话:问题改写(CondenseQuestionChatEngine)
  • 优化:切片方法选择、Embedding模型升级、Rerank重排序、HyDE假设文档嵌入
  • Lost in the Middle:关键信息被埋在无关信息中,大模型"视而不见"
  • 知识浓度:上下文中相关信息密度高、噪音少、与问题直接关联

提示词六要素

任务目标 / 上下文 / 角色 / 受众 / 样例 / 输出格式

提示词六大技巧

清晰表达+分隔符 / 限定角色受众 / 规定输出格式 / 少样本 / CoT(及ToT/GoT) / Meta Prompting

Meta Prompting 三角色

Critic(评估差距)→ Optimizer(重写提示词)→ Grader(量化评分)

AI裁判

  • 7:3 拆分训练集/评估集
  • 过拟合检测:训练准确率升但评估准确率停滞或下降
  • 选择评估集上最优版本,非训练集

推理模型提示词技巧

  1. 简洁清晰 + 足够背景
  2. 避免加"一步一步推理"
  3. 可补充角色/格式
  4. 适合做教练
  5. 根据模型响应迭代调整
  6. 混合分工:推理模型做规划,通用模型做执行

Ragas指标体系

  • Answer Correctness = 0.25×语义相似度 + 0.75×事实准确度
  • Context Recall:ground_truth观点在contexts中的覆盖率
  • Context Precision:contexts中相关条目排名靠前程度
  • Faithfulness:答案是否完全基于contexts,无幻觉
  • Answer Relevancy:答案是否直接回应问题
  • 三阶段分类:整体(AC) / 生成(Faithfulness+AR) / 召回(CR+CP)

评测先行三原因

避免盲目优化 / 量化改进效果 / 防止跷跷板效应

Agent核心技术

  • Function Calling → ReAct(Think→Act→Observe) → MCP协议(谁提供工具谁定义)
  • MCP = USB接口(Function Calling = 内部总线)
  • 结构化输出闭环:引导(指令+Schema+范例) → 校验 → 重试
  • 工作流:Pipeline / Branching / Parallel / MoA(多层) / HITL
  • 单Agent失败三因:注意力稀释 / 错误级联放大 / 扁平化vs结构化不匹配

Memory

  • Lost in the Middle效应(位置效应) vs 注意力稀释(长度效应)——不同概念
  • 三种策略:窗口截断 / 滚动摘要 / 向量化召回
  • 主动管理:static_control / agent_control

Skill

  • Skill vs RAG:程序性知识(怎么做) vs 陈述性知识(是什么)
  • 五步法:判断值不值 → 提取内容 → 写指令 → 配工具 → 验证迭代
  • Template模式(定结构) + Examples模式(定风格)
  • 工作流模式:检查清单 / 反馈循环 / 高风险操作(执行前验证)

评测驱动

  • 迭代式确立标准(从失败归纳评测点)
  • LLM-as-Judge四种偏见:风格 / 长度 / 好好先生 / 位置
  • 业务专家应成为评测标准Owner
  • Skill测试集:显式/隐式/含噪声/负向控制

蒸馏与LoRA

  • 蒸馏 = 微调 + 教师模型生成数据
  • 三条路径:数据合成(黑盒) / 知识蒸馏(白盒,软标签/暗知识) / 推理压缩(CoT轨迹)
  • 不适合蒸馏:需实时知识→蒸馏+RAG;需复杂推理→保留大模型;教师不稳定→先优化教师
  • LoRA:ΔW = A×B,参数量仅为全参数微调的0.4%
  • 过拟合判断:训练损失降、验证损失先降后升
  • 评测:语义正确 vs 字符串匹配

部署

  • vLLM:专用大模型推理框架,兼容 OpenAI API
  • 五种云方案:百炼 / FC(冷启动+调试难) / PAI-EAS(蓝绿部署+模型预热) / ECS(DeepGPU-LLM) / ACK
  • 模式:公共云 / 专有云 / 端云协同 / 嵌入式

生产实践

  • GPU必要:LLM推理=大规模矩阵运算,CPU架构不适合
  • max_tokens = 安全阀(非内容控制机制)
  • SLO:TTFT < 5s, TPOT < 200ms
  • 错误处理三原则:清晰易懂 / 具体明确 / 情感友好
  • ARMS可观测:Metrics(成本排名) / Traces(瓶颈定位) / Logs(质量/安全)
  • 多卡PD分离(DistServe) / MLOps

安全面

  • 提示词注入 vs 指令注入(两个不同攻击类型)
  • 关键词过滤三大局限:同义词绕过 / 编码混淆 / 猫鼠游戏
  • 五层纵深防御:资产盘点 → 基础设施 → 大模型安全(公平性/鲁棒性/可解释性) → 应用安全(输入/运行/输出) → 合规
  • 远距证明:硬件身份证明 + 软件完整性证明(高考类比:考场/座位/考前验证)
  • RAG高级防护:知识库访问控制(三步过滤) + 双重加密(AES-256文本 + DCPE向量)
  • 向量为什么要加密:可推断敏感主题+可近似反推原文
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容