在大模型LLM推理部署中,很多开发者都会遇到一个共性瓶颈:模型权重占用显存固定,但一旦开启长上下文、多并发请求,GPU显存瞬间被占满,出现OOM显存溢出、推理速度断崖式下跌。...
在大模型LLM推理部署中,很多开发者都会遇到一个共性瓶颈:模型权重占用显存固定,但一旦开启长上下文、多并发请求,GPU显存瞬间被占满,出现OOM显存溢出、推理速度断崖式下跌。...
本篇文章会接上一篇继续更新关于大模型落地在生产环境相关的一些优化实践策略,可以从各个方面去优化落地。 三、成本优化 3.1 优化系统性能时节约成本 第二章中许多性能手段同时降...
前言 将大模型应用从开发和测试阶段转移到实际业务场景,是一个复杂且关键的过程,涉及业务选型、系统架构、运维与合规等多方面考量。 功能性需求定义大模型「做什么」——问答、摘要、...
前言 微调解决的是「模型会不会做你的任务」;部署解决的是「业务能不能稳定、低成本地调用它」。 很多团队微调完成后卡在中间一步:Java 服务仍调云端大模型 API,微调成果没...
🚄 前言 Memory 让 Agent 记住了你的偏好,但具体的工作方法每次还是要在对话里重新交代。Skill 就是解决这个问题的:把「在什么情况下,正确做法是什么」固化为可...
写在前面:接上篇之后要做什么 上篇走完「教师模型打标 → 过滤 → Baseline」,基座 0.6B 的 JSON 合规率和路由准确率往往惨不忍睹,而教师模型已经稳定。本篇...
代码策略:能落在 Java 工程里的部分(教师 API 调用、标注校验、评测指标、数据加载)用 JDK 17 + Jackson + HttpClient 实现;LoRA 训...
承接:RAG 自动化评测体系[https://www.jianshu.com/p/0de7ffc44beb](先学会度量「答案质量」,再度量「过程与工具路径」)。 🚄 前言 ...
承接:上篇:从审查痛点到高质量 Skill[https://www.jianshu.com/p/0169231762cb?v=1779173759014]。 🚄 前言 上篇你...
🚄 前言 Memory 让 Agent 记住了你的偏好,但具体工作方法每次还要在对话里重新交代。Skill 把「在什么情况下、正确做法是什么」固化为可触发的专属流程。 0 为...
栈说明:示例运行在 AgentScope Java(io.agentscope:agentscope)上,模型为 阿里云通义 DashScope。短期记忆用 InMemory...
🚄 前言 之前我整理过一篇关于:关于设计多智能体(Multi-Agent)架构的工程与实践总结[https://www.jianshu.com/p/b200496d1573]...
1.1 固定工作流的局限性 在上一篇文章中,学习了如何为重复性工作构建固定的工作流。假设你需要为公司开发了一个「课程前期调研」机器人,它有一个固定的流程:当收到调研需求时,并...
1. 为什么单 Agent 会失控 根据样例举个例子说明吧: 周一早上,你收到了这样一条消息: "上周五提交的《Python数据分析入门》课程需要尽快上线。能不能用你那个AI...
前言:为什么「请别改代码」不够 大模型以「续写更合理、更通顺的文本」为优化目标,没有编译器或运行时的硬约束。Notebook 润色场景里,它可能把 usr_id「规范」成 u...
答疑机器人接上 RAG 后,能解决「手册里写过」的问题,但遇到实时联网、查库、调业务 API 时,仅靠生成式模型不够——需要让模型「指挥」外部工具。我把课程里 1~3 节的路...
面向 Java 高级开发 的技术笔记:先把 Ragas、TruLens、DeepEval 等「以 Python 生态见长」的框架放在同一张认知地图里;第三节展开 Answer...
提示词工程实战(续):推理大模型怎么搭配提示词使用? 上一篇我整理了通用大模型下的提示词框架与技巧(RAG、角色、格式、Meta Prompting 等)。本篇补一块同样重要...