🤖 AI 让内容生成越来越便宜,但人的注意力没有同步变多 当“写”几乎没有成本以后,真正稀缺的,开始变成判断、验证和压缩
先算一笔账:一个 Agent 跑复杂长任务,API 成本会随任务长度放大,一旦失控打转,烧掉的不只是 token,还有用户的信任和耐心。这是质量问题,也是真金白...
上周给团队做模拟面试,我问了一道题:"怎么测一个会自己改自己的系统?"现场安静了三秒。这道题不是凭空编的。2026年8月13日晚,DeepSeek 发布了首款开...
脚本自动化来的时候,有人说手工测试要完了;持续交付来的时候,有人说不懂流水线的测试要完了;大模型来的时候,又有人说不懂评测的要完了。
上次我们发了 DeepSeek Harness(dsh)的实测文章,评论区被问得最多的就是这一句:它到底能替测试开发干多少活?这个问题听着简单,其实没法一句话回...
AI 测试开发面试高频题:"大模型接口常见的边界问题有哪些?" 边界值分析是测试的老手艺,但大模型的边界换了形态:输入有上下文窗口,输出有 max_tokens...
AI 测试开发面试高频题:"怎么检测和防控大模型幻觉?" 幻觉不是偶发 bug,而是生成模型的概率行为。测试的职责不是"消灭幻觉",而是把它压进阈值、让它可观测...
AI 测试开发面试高频题:"测 Agent 和测普通接口有什么本质区别?" 普通接口测的是"一次调用对不对",Agent 测的是"一条决策链会不会失控"。这篇用...
AI 测试开发面试高频题:"Function Calling / Tool Use 怎么测?" 工具调用是 Agent 的手脚,也是事故重灾区:模型会编造不存在...
AI 测试开发面试高频题:"Prompt 变更怎么防回归?" Prompt 是代码,但它比代码危险:改一个错别字不会有编译错误,却可能让模型行为整体漂移。这篇讲...
AI 测试开发面试高频题:"你们怎么评测 RAG 系统的质量?" 答"看回答得对不对"只能算及格。这篇讲一次真实的"答非所问"故障是怎么定位到检索层的,以及黄金...
AI 测试开发面试高频题:"大模型的输出是不确定的,你怎么做自动化测试?" 这篇用一个真实线上故障,完整还原 AI 测试开发工程师的处理过程:怎么定位、怎么写代...
但是,大语言模型(Large Language Model,LLM)的出现改变了这一切。
霍格沃兹测试开发学社,隶属于测吧(北京)科技有限公司,是一个专注软件测试、自动化测试、人工智能测试与测试开发的技术交流社区,并参与高校测试实训、火焰杯赛事及工程...