首页
学习
活动
专区
圈层
工具
发布
首页标签测试开发

#测试开发

AI 写了 30 页,人只看 3 行:我们可能正在进入「文档通胀」时代

蔡金伟

🤖 AI 让内容生成越来越便宜,但人的注意力没有同步变多 当“写”几乎没有成本以后,真正稀缺的,开始变成判断、验证和压缩

3200

从DeepSeek Harness,看懂大厂为什么越来越重视AI测试

霍格沃兹-测试开发学社

先算一笔账:一个 Agent 跑复杂长任务,API 成本会随任务长度放大,一旦失控打转,烧掉的不只是 token,还有用户的信任和耐心。这是质量问题,也是真金白...

14510

DeepSeek Harness上线后,我整理了10道可能出现在测试开发面试里的题

霍格沃兹-测试开发学社

上周给团队做模拟面试,我问了一道题:"怎么测一个会自己改自己的系统?"现场安静了三秒。这道题不是凭空编的。2026年8月13日晚,DeepSeek 发布了首款开...

16910

从DeepSeek Harness到AI测试:测试开发的下一站到底在哪里?

霍格沃兹-测试开发学社

脚本自动化来的时候,有人说手工测试要完了;持续交付来的时候,有人说不懂流水线的测试要完了;大模型来的时候,又有人说不懂评测的要完了。

20210

实测DeepSeek Harness:AI到底能替测试开发做多少工作?

霍格沃兹-测试开发学社

上次我们发了 DeepSeek Harness(dsh)的实测文章,评论区被问得最多的就是这一句:它到底能替测试开发干多少活?这个问题听着简单,其实没法一句话回...

19410

聊着聊着就报错了——上下文溢出与 Token 边界测试

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"大模型接口常见的边界问题有哪些?" 边界值分析是测试的老手艺,但大模型的边界换了形态:输入有上下文窗口,输出有 max_tokens...

9210

模型一本正经地胡说八道——幻觉检测与线上监控

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"怎么检测和防控大模型幻觉?" 幻觉不是偶发 bug,而是生成模型的概率行为。测试的职责不是"消灭幻觉",而是把它压进阈值、让它可观测...

7910

Agent 半夜陷入死循环,一夜烧掉上万 token——轨迹测试与熔断

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"测 Agent 和测普通接口有什么本质区别?" 普通接口测的是"一次调用对不对",Agent 测的是"一条决策链会不会失控"。这篇用...

11800

模型编造 API 参数,工具调用连环 500——Function Calling 契约测试

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"Function Calling / Tool Use 怎么测?" 工具调用是 Agent 的手脚,也是事故重灾区:模型会编造不存在...

18010

改了一行 Prompt,用例全红了——Prompt 回归测试与 CI 门禁

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"Prompt 变更怎么防回归?" Prompt 是代码,但它比代码危险:改一个错别字不会有编译错误,却可能让模型行为整体漂移。这篇讲...

16310

RAG 上线后为什么总"答非所问"?黄金数据集与检索质量评测

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"你们怎么评测 RAG 系统的质量?" 答"看回答得对不对"只能算及格。这篇讲一次真实的"答非所问"故障是怎么定位到检索层的,以及黄金...

13910

同一个接口每次返回都不一样?大模型输出的可靠断言怎么写

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"大模型的输出是不确定的,你怎么做自动化测试?" 这篇用一个真实线上故障,完整还原 AI 测试开发工程师的处理过程:怎么定位、怎么写代...

12100

AI Agent测试实战:如何测试一个会自主决策的软件系统?

霍格沃兹-测试开发学社

18310

RAG系统测试实战:如何验证企业知识库AI助手是否可靠?

霍格沃兹-测试开发学社

21210

LLM测试体系设计:从Prompt测试到模型质量评估的完整实践

霍格沃兹-测试开发学社

但是,大语言模型(Large Language Model,LLM)的出现改变了这一切。

16410

5年测试开发面试为什么开始考算法?从测试平台到AI质量工程看技术能力变化

霍格沃兹-测试开发学社

霍格沃兹测试开发学社,隶属于测吧(北京)科技有限公司,是一个专注软件测试、自动化测试、人工智能测试与测试开发的技术交流社区,并参与高校测试实训、火焰杯赛事及工程...

15410
领券