上周一个做后台测试的朋友在群里发了条消息,我看完有点五味杂陈。 他们团队三月份接了个大模型,做了个"智能客服 + 内部知识库问答"。上线前老板把验收的活儿丢给他:"你给这套 ...
上周一个做后台测试的朋友在群里发了条消息,我看完有点五味杂陈。 他们团队三月份接了个大模型,做了个"智能客服 + 内部知识库问答"。上线前老板把验收的活儿丢给他:"你给这套 ...
很多企业第一次做 Agent 测试的时候,都会建立一套测试集。 100条。 500条。 甚至1000条。 上线之前跑一次: 大家觉得: 差不多,可以上线了。 但 Agent ...
今年秋招,一个数字非常值得应届生关注。 据近期公开报道援引脉脉数据,2026年前5个月新发校招AI岗位同比增长47.3%,AI岗位渗透率从26.41%上升到37.56%。([...
上次我们发了 DeepSeek Harness(dsh)的实测文章,评论区被问得最多的就是这一句:它到底能替测试开发干多少活?这个问题听着简单,其实没法一句话回答——测试开发...
回看测试这个职业的十几年,你会发现一部被浪潮反复追赶的历史。 脚本自动化来的时候,有人说手工测试要完了;持续交付来的时候,有人说不懂流水线的测试要完了;大模型来的时候,又有人...
上周给团队做模拟面试,我问了一道题:"怎么测一个会自己改自己的系统?"现场安静了三秒。这道题不是凭空编的。2026年8月13日晚,DeepSeek 发布了首款开源 Agent...
先算一笔账:一个 Agent 跑复杂长任务,API 成本会随任务长度放大,一旦失控打转,烧掉的不只是 token,还有用户的信任和耐心。这是质量问题,也是真金白银的经营问题—...
AI 测试开发面试高频题:"大模型接口常见的边界问题有哪些?"边界值分析是测试的老手艺,但大模型的边界换了形态:输入有上下文窗口,输出有 max_tokens,计费有 tok...
AI 测试开发面试高频题:"大模型服务怎么做性能测试?和传统压测有什么区别?"传统接口压测看 QPS 和 RT,大模型压测看的是"用户等多久看到第一个字、每个字隔多久蹦出来"...
AI 测试开发面试高频题:"大模型应用的安全测试怎么做?"传统安全测试盯的是系统漏洞,AI 安全测试盯的是"模型的服从性"——攻击者不碰你的代码,只用自然语言就能让模型叛变。...
AI 测试开发面试高频题:"怎么检测和防控大模型幻觉?"幻觉不是偶发 bug,而是生成模型的概率行为。测试的职责不是"消灭幻觉",而是把它压进阈值、让它可观测、可告警、可回滚...
AI 测试开发面试高频题:"流式输出接口怎么测?和普通 HTTP 有什么区别?"普通接口测"一次响应",流式接口测"一条事件流"——首字快不快、中间卡不卡、结尾完不完整、断了...
AI 测试开发面试高频题:"测 Agent 和测普通接口有什么本质区别?"普通接口测的是"一次调用对不对",Agent 测的是"一条决策链会不会失控"。这篇用一次半夜烧钱的真...
04 | 模型编造 API 参数,工具调用连环 500——Function Calling 契约测试 AI 测试开发面试高频题:"Function Calling / Too...
AI 测试开发面试高频题:"Prompt 变更怎么防回归?"Prompt 是代码,但它比代码危险:改一个错别字不会有编译错误,却可能让模型行为整体漂移。这篇讲怎么把 Prom...
AI 测试开发面试高频题:"你们怎么评测 RAG 系统的质量?"答"看回答得对不对"只能算及格。这篇讲一次真实的"答非所问"故障是怎么定位到检索层的,以及黄金数据集 + 分层...
AI 测试开发面试高频题:"大模型的输出是不确定的,你怎么做自动化测试?"这篇用一个真实线上故障,完整还原 AI 测试开发工程师的处理过程:怎么定位、怎么写代码、最后沉淀成什...