摘要: Agent 能力越来越多以后,一个很现实的问题开始出现: 到底该调用哪个 Tool、加载哪个 Skill、连接哪个 MCP? 5 个工具时,让 LLM 自己选可能没什...
摘要: Agent 能力越来越多以后,一个很现实的问题开始出现: 到底该调用哪个 Tool、加载哪个 Skill、连接哪个 MCP? 5 个工具时,让 LLM 自己选可能没什...
摘要: 做 RAG 时,一个很常见的问题是: 检索能召回很多内容,但真正应该塞进 LLM 的,其实只有少数几条。 传统方案会用 Embedding 阈值、Cross-Enco...
去年双十一大促前,我们发了一个版本。回归测试跑了整整三天。 第三天凌晨两点,办公室里只剩我和另一个同事,对着CI上一片红,谁都不想说话。不是没测完,是测完了不敢信——失败列表...
摘要: Google 最近开源了一个很值得测试开发关注的项目——ARTEMIS。 它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Androi...
同一个开发者上午让Copilot解释一段代码,下午让它修改支付逻辑。两个任务都选“自动模型”,背后却可能走不同模型、不同推理预算和不同成本路径。 GitHub 9月18日更新...
摘要:Google与Speakeasy开放OpenAPI生成工具后,本文聚焦生成式SDK的质量门:同一规范在不同语言里必须保持序列化、错误、流式取消和版本来源一致。 9月17...
摘要:GitHub 9月18日支持用REST API管理代码覆盖率规则。本文说明怎样把最小覆盖率、最大下降幅度、例外和规则漂移纳入测试。 一个组织有40个仓库。A仓要求覆盖率...
摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。 很多校招项目写到“根据OpenAPI自动生成客户...
摘要: Jev 发布不到一周,已经被 Vercel AI Gateway、LangChain 等 Agent 基础设施快速接入。 一个不会聊天、不负责写代码、甚至主要输出 C...
一次上线后,运营后台的订单金额全变成了 NaN。翻日志才发现,上游订单接口把 amount 从 number 悄悄改成了 string——字段名一个没动,返回码还是 200,...
一条链路是这样的:大模型返回一段 JSON,测试用例 assert result == {"order_id": "A1001", "amount": 99, "refund...
一段很常见的 pytest 代码:测试一个下单服务,作者写下 mock_db = MagicMock(),然后既让它 return_value 返回一条订单,又在结尾 moc...
打开 Playwright 官方文档,你会发现一个多数团队都用错的能力:它把无障碍树(accessibility tree)当作定位与断言的一等公民。getByRole、ge...
客服 RAG 应用上线前,测试跑了一整轮功能用例:问订单状态答得对,问退款政策答得对,问知识库里的产品参数也答得对。全绿,签收上线。 上线第二天,一个用户在对话框里敲了一句:...
把接口调用链 Trace 搬到 AI 应用:给 retrieval / prompt / llm / tool / postprocess 每段都留可断言的中间产物把接口调用...
每次线上漏测,会议室里的第一反应几乎都一样:「这个测试怎么没测到?」于是动作也高度一致——补一条用例,塞进回归集,下次不再漏。可如果把这半年漏掉的缺陷一条条拉出来做归因,会看...
阿里通义把一款终端编程 Agent「Qwen Code」开源了,仓库就挂在 GitHub 上(QwenLM/qwen-code),自述一句话:An open-source A...
一个越权漏洞怎么被测出来:给权限矩阵织一张可回归的『水平/垂直越权』测试网 审计里翻出这样一个反常现象:登录正常、鉴权中间件在跑、每个接口的功能单测全绿——可测试同学拿用户 ...