4. 构建Agentic AI的实用技巧

系统输出质量优化

为什么需要组件级评估?--可复现、低成本的改进度量

识别问题:

错误分析的核心是观察和量化,以找出工作流程中表现最差的组件。

检查追踪 (Traces) 和中间输出:

定义: agent在运行过程中,每一步产生的中间输出的整体集合被称为追踪 (trace)。单个步骤的输出有时被称为 span。

聚焦错误案例并量化

改进问题:

对于非 LLM 组件,比如网页搜索、RAG 检索、代码执行、传统 ML 模型来说。调整参数或超参数:网页搜索: 调整结果数量、日期范围等。RAG 检索: 更改相似度阈值、文本分块大小等。人物检测: 调整检测阈值,以权衡误报和漏报。替换组件: 更换不同的服务提供商,如不同的 RAG 搜索引擎、不同的 Web 搜索 API找到最适合系统的一个。例如,在国内查询企业营收报表和财务信息,使用百度搜索的效果就远超Bing或Google,但查询学术资源却完全相反。

对于LLM 组件,改进主要围绕输入、模型本身和工作流程结构展开。

改进提示词:增加明确指令(在提示词中指明一些资源和任务应有的规划路径);使用少样本提示 (添加具体的输入和期望输出示例);尝试不同的 LLM: 多测试几款 LLM,并使用评估 (Evals) 来选择最适合特定应用的最佳模型。任务分解:步骤指令复杂,导致 LLM 难以准确执行,考虑将任务分解为更小的、更易于管理的步骤,比如拆成生成步骤 + 反思步骤,或连续多次调用。微调模型:这是最复杂、成本最高的选项。只有在穷尽所有其他方法后,仍需要挤出最后几个百分点的性能改进时才考虑。它适用于更成熟且性能要求极高的应用。

拥有对不同 LLM 能力的直觉,能使开发者更高效地选择模型和编写提示词。这样的直觉要如何培养?

1) 频繁试玩不同模型: 经常测试新的闭源和开源模型,观察它们在不同查询上的表现。2) 建立个人评估集: 使用一套固定的评估任务来校准不同模型的能力。3) 阅读他人的提示词: 大量阅读从业者、专家或开源框架中的提示词,了解不同任务/模型/场景下的最佳实践,提高自己编写提示词的能力。4) 在工作流程中尝试: 实际在Agent工作流程中尝试不同的模型,查看追踪 (Traces) 和组件/端到端评估,观察它们在特定任务中的性能、价格和速度的权衡。(不是很懂和1的区别)

效率成本优化

优化工作流程的延迟和成本

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容