摘要: Agent 能力越来越多以后,一个很现实的问题开始出现: 到底该调用哪个 Tool、加载哪个 Skill、连接哪个 MCP? 5 个工具...
摘要: 做 RAG 时,一个很常见的问题是: 检索能召回很多内容,但真正应该塞进 LLM 的,其实只有少数几条。 传统方案会用 Embeddin...
去年双十一大促前,我们发了一个版本。回归测试跑了整整三天。 第三天凌晨两点,办公室里只剩我和另一个同事,对着CI上一片红,谁都不想说话。不是没测...
摘要: Google 最近开源了一个很值得测试开发关注的项目——ARTEMIS。 它不是帮你简单生成几段 Appium 脚本,而是让 AI Ag...
同一个开发者上午让Copilot解释一段代码,下午让它修改支付逻辑。两个任务都选“自动模型”,背后却可能走不同模型、不同推理预算和不同成本路径。...
摘要:Google与Speakeasy开放OpenAPI生成工具后,本文聚焦生成式SDK的质量门:同一规范在不同语言里必须保持序列化、错误、流式...
摘要:GitHub 9月18日支持用REST API管理代码覆盖率规则。本文说明怎样把最小覆盖率、最大下降幅度、例外和规则漂移纳入测试。 一个组...
摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。 很多校招项目写到“...
摘要: Jev 发布不到一周,已经被 Vercel AI Gateway、LangChain 等 Agent 基础设施快速接入。 一个不会聊天、...