上周一个做后台测试的朋友在群里发了条消息,我看完有点五味杂陈。 他们团队三月份接了个大模型,做了个"智能客服 + 内部知识库问答"。上线前老板把...
很多企业第一次做 Agent 测试的时候,都会建立一套测试集。 100条。 500条。 甚至1000条。 上线之前跑一次: 大家觉得: 差不多,...
今年秋招,一个数字非常值得应届生关注。 据近期公开报道援引脉脉数据,2026年前5个月新发校招AI岗位同比增长47.3%,AI岗位渗透率从26....
上次我们发了 DeepSeek Harness(dsh)的实测文章,评论区被问得最多的就是这一句:它到底能替测试开发干多少活?这个问题听着简单,...
回看测试这个职业的十几年,你会发现一部被浪潮反复追赶的历史。 脚本自动化来的时候,有人说手工测试要完了;持续交付来的时候,有人说不懂流水线的测试...
上周给团队做模拟面试,我问了一道题:"怎么测一个会自己改自己的系统?"现场安静了三秒。这道题不是凭空编的。2026年8月13日晚,DeepSee...
先算一笔账:一个 Agent 跑复杂长任务,API 成本会随任务长度放大,一旦失控打转,烧掉的不只是 token,还有用户的信任和耐心。这是质量...
AI 测试开发面试高频题:"大模型接口常见的边界问题有哪些?"边界值分析是测试的老手艺,但大模型的边界换了形态:输入有上下文窗口,输出有 max...
AI 测试开发面试高频题:"大模型服务怎么做性能测试?和传统压测有什么区别?"传统接口压测看 QPS 和 RT,大模型压测看的是"用户等多久看到...