一、先搞清楚:AI测试不是"用AI做测试"那么简单 很多人一听到"AI测试",第一反应是:"哦,就是用ChatGPT、Cursor、Claude Code 这些AI 工具生成测试用例呗。" "我用ChatGPT写过测试用例"——这叫"用AI辅助测试",不叫"AI测试" 2. "我测过公司的大模型产品"——这叫"测试AI系统",是AI测试的一部分 3. 三、AI测试的三种形态:我理解的定义 我认为,AI测试应该包含三个层面,这三个层面构成了一个完整的AI测试能力模型: 形态一:AI辅助测试(AI-Assisted Testing) 定义:用AI工具提升传统测试活动的效率和质量 为了讲清楚AI 测试与传统测试之间的区别,我列了一个对比表,但先声明:这不是"AI测试取代传统测试"的意思,而是"AI测试扩展了传统测试的边界"。 AI测试并不是单纯的传统测试的"升级版",也不是"用AI工具做传统测试"。AI 测试 它是一个新的测试范式,需要新的思维方式、新的评估维度、新的技能栈。 理解这一点,是你转型AI测试的第一步。
AI抢不走测试人的饭碗,但会用AI的测试人,会抢走你的本文来自一个把AI测试真正落地并开源的团队:https://gitee.com/wwcs/ai_test_sheng附在线体验环境:http://111.229.22.12 (账号admin/admin123)前言:先说一个扎心的事实测试圈这两年最焦虑的问题:"AI会不会取代测试工程师?" 但会用AI的测试人,会取代不会用AI的测试人。同一批需求,别人还在手动点点点、熬夜写用例,会用AI的人已经把需求分析、用例设计、执行、报告一条龙跑完了,还附赠一套能自动维护的UI自动化脚本。 但先别急着冲——AI测试落地,Demo很惊艳,实战全是坑。 测试,不如来体验一下真实跑起来的AI测试。
通过结合AI与传统测试方法,企业能够更有效地应对复杂的开发环境,从而提高最终产品的质量和用户满意度。一、软件测试软件测试是软件开发中至关重要的一环,主要目标是查找软件中的缺陷(bug),保障软件质量。 ②作用提高速度和效率缺陷预测与分析③AI应用于软件测试的方式AI通过与测试工程师的互动来增强测试过程。通过输入具体的指令(Prompt),工程师可以指导AI生成所需的测试用例、报告或分析。 ④AI赋能软件测试的具体应用需求评审:AI可以帮助分析需求文档,识别潜在的模糊或不一致之处,提高需求的明确性。测试计划编写:AI可以根据项目需求和历史数据生成测试计划,节省时间并提高效率。 测试用例设计:通过自动生成测试用例,AI能够快速覆盖各种场景,尤其是在面对复杂系统时。测试报告生成:AI能够自动整理测试结果,并生成易于理解的报告,帮助团队做出决策。 自动化测试:AI赋能的自动化测试不仅可以执行重复性测试,还能在代码更新时自动调整测试用例,确保持续集成的有效性。业务代码编写:AI能够协助开发人员编写代码,并提供实时的错误调试和注释建议。
在这些测试社区和社群中,我遇到了许多关于AI测试的问题,例如什么是AI测试,如何进行AI测试,AI测试有哪些工具与方法等。 然而,当我在网上搜索AI测试相关的书籍时,却发现大量的AI开发相关书籍,却鲜有专门介绍AI测试的书籍。这说明测试业界仍在混沌中不断摸索前进。 AI测试的迷思 在讨论AI测试时,通常存在两种理解: 第一种是利用AI辅助当前的软件测试,例如使用AI系统学习测试分析和测试设计,进而自动生成测试用例并自动化实现这些测试用例。 因此,AI辅助测试仍有很长的路要走。 第三个问题:哪些软件系统能用AI辅助测试? 理论上,任何软件系统都可以使用AI来辅助自动化测试工作。 总结 通过上面对于问题的回答,希望能解决大家对于AI测试的困惑,包括了解什么是AI测试,自己的项目是否适合使用AI测试,以及未来是否需要在AI测试上投资等问题。
那一刻,我知道自己需要系统性地学会一件事:如何测试AI幻觉。一、先搞清楚你在测什么"幻觉"这个词,在AI领域被用得太宽泛了。 测试集的设计需要特别关注三类场景:知识边界场景:主动测试AI知识截止日期附近的事实,以及它可能不熟悉的专业领域知识。 测试方法:给AI提供一段明确的参考文档,然后问与文档内容相关的问题,再用独立的评估器(或人工)逐条核验:AI的每一个陈述,能不能在提供的文档里找到明确的依据? 这个结构,比单轮问答测试要复杂得多,但它测到的是AI在真实使用场景下的真实行为。 (如"美托洛尔"vs"美托洛尔琥珀酸盐")的剂量差异问超出AI应该回答的范围的问题(如"帮我直接开一个处方")——测试AI能否正确识别边界并拒绝第3层:对话一致性集(Consistency Set)设计多轮对话测试树
简而言之,您不会像对其他项目进行质量检查那样对AI项目进行质量检查。这是因为对于AI项目而言,我们要测试的内容,测试方式以及测试时间的概念大不相同。 在AI的训练和推理阶段进行测试和质量保证,那些有机器学习模型训练经验的人都知道测试实际上是使AI项目正常工作的核心要素。您不仅可以开发AI算法,还可以将训练数据投入其中。 完成此操作后,您可以返回并使用其他预留测试数据来验证模型是否确实按预期工作。尽管这是测试和验证的所有方面,但它发生在AI项目的训练阶段。这是在AI模型投入运行之前。 这意味着,如果您不是从头开始编写代码,那么就实际代码而言,几乎没有什么要测试的-假设算法已经通过了测试。在AI项目中,假设已按照预期实施了QA,则质量检查将永远不会专注于AI算法本身或代码。 您需要测试将AI模型投入生产的代码-AI系统的操作组件。这可能会在AI模型投入生产之前发生,但是实际上您并没有在测试AI模型。相反,您正在测试使用该模型的系统。
什么是精准测试精准测试主要解决测试分析以及测试执行两个维度的问题,作为QA团队,变更的输入主要来源两方:一方是来自业务产品侧的业务变更,一方是研发侧的代码变更。 如何在需求/代码变更后快速准确的评估测试范围,高效召回并执行用例,最终通过覆盖率等量化指标评估测试效果是精准测试主要的价值体现。 AI+精准测试能做什么充分发挥LLM在信息理解以及生成方面的能力优势,LLM将原本干枯的系统链路信息,结合技术文档,API文档生成可读性更好的节点信息摘要;将召回的繁杂冗长的用例信息通过LLM进行信息摘要后变的可读性更好 IM通知AI+精准测试能力升级LLM基于变更方法,系统链路以及召回用例信息输出测试建议。 开发精准测试SKILL,可本地AIIDE和远程claw触发和执行精准测试流程-开发中。
ChatGPT这个词相信大家最近看到都不会陌生,应该刷爆了各位的朋友圈,各种分享注册教程、什么AI写代码的文章比比皆是,今天,让我们一起来看一下OpenAI能不能教我们学测试呢,对测试人员的日常工作是否有帮助呢 二、AI智能对话初体验 注册账号后,通过对话,我们来看一下AI会教我们怎么去学测试呢? 怎么判断自己目前是否适合转行做测试? 软件测试的基本流程是什么? 数据库怎么去学? 测试环境怎么搭建? 自动化框架的设计思路? 测开要具备哪些技能? 面试时怎么谈薪资? 印象深刻的bug? 接口幂等什么意思? 自动化测试的高频面试题 如何在团队中推广自动化测试? UI自动化定位不到元素有哪些原因? 看到这,你是不是以为AI是万能的呢?
01 AI测试工具概述 AI测试工具是利用人工智能(AI)和机器学习(ML)自动化和优化软件应用程序测试过程的软件解决方案。 这些工具通过使用AI算法来识别模式、检测错误,甚至预测应用程序中的潜在故障,从而增强了传统的测试自动化。与传统的测试方法不同,AI测试工具能够适应代码的变化,使它们对动态和复杂的应用程序更加高效。 10 Test.ai 最适合移动应用测试 Test.ai 提供专门为移动应用程序设计的人工智能驱动解决方案。它能自主生成并执行测试,确保你的应用程序在部署前没有漏洞。 17 Gru.ai 最适合智能自动化测试 Gru.ai 是一款新兴的、由人工智能驱动的软件测试工具,专注于智能自动化测试。它运用机器学习来预测测试场景、识别瓶颈,并减少自动化测试中的误报情况。 测试资料),欢迎对技术感兴趣的朋友一起来交流使用~ 点击下方关注公众号《测试开发技术》,获取免费测开学习路线、简历模板、面试真题、AI测试、AI 编程、自动化测试、测试开发资料教程等。
准备需求文档与测试范围定义:在启动AI编写测试用例前,需要先明确测试目标和范围。首先要准备详细的需求文档,包括功能描述、业务逻辑、用户场景等关键信息。 明确测试范围有助于AI更聚焦地生成相关测试用例,避免生成无关或超出范围的内容。 AI工具选择与配置:根据前期工作,可选择codebuddy、cursor、trae等AI编辑器或cherrystudio等API调用工具。 不同工具各有特点,AI编辑器适合直接在编辑器中进行测试用例的编写和修改,操作便捷;而API调用工具则可以集成到现有的测试流程或系统中,实现更自动化的测试用例生成。 生成用例:处理用例:然后就可以复制用例,当然只是简单演示,重点就是智能体的设定,需要告知ai以什么形式返回。其他工具同理。
据2024年Apex.ai《全球质量工程趋势报告》显示,73%的头部科技企业已在性能测试环节引入AI能力,平均将高危性能缺陷检出时间缩短68%,资源消耗降低41%。 这并非技术噱头,而是测试范式从‘验证正确性’向‘预测风险性’的战略跃迁。本文聚焦AI如何真正赋能性能测试效能革命,为测试专家提供可落地的技术路径与实践洞察。 一、AI不止于‘自动化’:重构性能测试的认知边界 很多团队误将AI测试等同于‘用AI写脚本’,实则大谬。 人机协同层:AI不是替代测试工程师,而是扩展其认知带宽。 结语 AI驱动的性能测试优化,终极目标不是让机器跑得更快,而是让质量决策更早、更准、更稳。
每日AI知识点 · 第12期 AI + 测试 用 AI 重塑软件质量保障 用例生成 智能执行 缺陷预测 智能报告 AI 如何改变测试 第一章 AI 用例生成:从需求到用例只需5分钟 第二章 智能执行 & 缺陷预测 第三章 ️ AI 测试工具全景 第四章 AI 测试落地四步法 第五章 AI 测试能力成熟度模型 对照下表 L3 进阶 智能执行+AI报告分析 建立缺陷预测能力 L4 高级 缺陷预测+智能回归 探索全自主 AI 测试 今日金句 AI 测试 = 更快发现缺陷 + 更广覆盖范围 + 更少重复工作 AI 不会替代测试工程师 ,但会用 AI 的测试工程师会替代不用 AI 的。 用例生成 · 效率提升10倍 缺陷预测 · 提前发现问题 智能执行 · 自动维护脚本 智能报告 · 一键质量洞察 你在测试工作中用过 AI 吗? 是用 AI 生成测试用例?
建立测试基线测试基线,是一个参考项目管理的“项目计划基线”,建立的属于测试迭代的概念和方法。 当小到一个单元功能,大到一个模块或者软件准备交付的时候,会按照开发、数据、业务对接的需求,建立一个最小的测试样本集合,这个就是我们说的测试基线,所有后续的测试活动,都会以项目为单位,在该项目的测试基线上开展 ,原则上,测试基线是每一轮各种测试的最小集合,而且基线会随着功能迭代、需求调整或者错误数量进行适应性调整。 如果你的第一反应是太繁琐,那大概率,是因为你的测试工作主要依靠的还是人,还没有真正的交给AI大模型和AIAgent。先讲一个我们真实经历过的、灰头土脸的困境。 系列最后一篇,我们把前面十一座冰山叠起来看它的形状:成熟度模型——一个AI工程体系,从"能用"到"敢用"再到"依赖它",到底要走过几级。
关注这个是因为想让自己许多相对简单的工作部分给到AI处理。 国内也有大佬测试了多智能体的生信分析,今天就测试下。 软件已经有不少博客等进行了介绍,开始时发现作者没有提供一个使用文档,就暂时没有进行测试,最近作者进行了文档更新,并准备近期发布新的版本,这里就测试一下。 pwd=ai4s 提取码: ai4s # 填入API key后运行 python run.py demo测试的一波三折 首先使用了国产之光deepseek的API,根据表现其代码能力已经接近了claude 最后,看到作者用的是一个特定的三方,于是决定用同样的再测试一下,终于跑通了。
引言:当测试遇见AI,开源正在重塑质量保障范式 在CI/CD节奏日益加速、微服务与云原生架构全面普及的今天,传统手工+脚本化测试已难以应对每日数百次发布的质量挑战。 破局关键,正从‘更多人力’转向‘更智能的工具’——AI驱动的开源测试方案,正以可审计、可定制、可集成的独特优势,成为头部科技公司与测试专家的新共识。 一、为什么是‘开源’? ——AI测试不能只靠黑箱SaaS 商业AI测试平台(如Applitools、Mabl)虽提供视觉验证、自愈脚本等能力,但其核心模型封闭、训练数据不可见、策略不可调优,对金融、政务、嵌入式等强合规场景构成隐性风险 Keploy(云原生API测试新锐)专为微服务设计,通过eBPF无侵入捕获真实流量,自动生成带AI校验逻辑的测试用例(如自动识别‘金额字段应为正数’并注入边界值变异)。 结语:开源不是终点,而是质量智能的起点 AI驱动的测试开源方案,本质是把测试工程师从‘重复执行者’解放为‘质量策展人’——定义AI的学习目标、校准它的判断边界、设计它的协作接口。
测试工程师正站在一个全新战场的入口:AI安全测试(AI Security Testing),它不是对AI的‘功能验证’,而是对AI‘行为鲁棒性、逻辑可解释性与对抗免疫力’的系统性攻防检验。 一、为什么传统测试方法在AI面前集体失灵? 传统测试依赖确定性输入->预期输出映射,而AI模型本质是非线性、概率化、数据依赖的黑盒(即使开源模型权重,推理过程仍具混沌性)。 三、如何让AI安全测试真正‘上线’? :所有AI安全测试报告必须回答‘业务影响是什么’。 结语:AI安全测试不是新岗位,而是测试工程师的能力升维 开源工具不会自动带来安全,但它们把曾经属于AI研究员的‘模型攻防’能力,封装成测试工程师可掌握的CLI命令与YAML配置。
传统功能与性能测试已无法覆盖AI特有的不确定性、数据依赖性与黑盒决策逻辑。作为测试专家,我们亟需构建一套融合AI特性、可工程化落地的安全测试方法论。 本文将从攻击面建模、核心测试技术、实践框架与行业案例四方面,深度解析AI安全测试的技术内核。 三、构建可落地的AI安全测试框架: TestOps for AI 我们提出‘三层四环’AI安全测试框架: 基础层:集成数据血缘追踪(Apache Atlas)、模型版本管理(MLflow)、安全基线库 (NIST AI RMF映射); 测试层:模块化测试套件(对抗测试/公平性测试/提示鲁棒性测试/供应链扫描)支持CI/CD嵌入; 报告层:生成符合ISO/IEC 23053标准的AI安全测试报告,含风险热力图 结语 AI安全测试不是给模型加一道防火墙,而是以测试为探针,深入AI系统的认知逻辑与数据肌理。
AI测试核心问题一、AI生成测试用例的质量验证(审查清单+破坏性验证)1.静态质量审查清单(可直接落地的Checklist)从6个核心维度做静态校验,无需执行即可筛除80%以上的低质量用例。 模糊输入测试:给出不完整、模糊的需求描述,验证AI是否会编造不存在的步骤和预期,还是主动标注不确定或询问补充。合格标准:不编造事实,不臆测缺失信息。 矛盾需求测试:输入前后矛盾的约束条件,验证AI是否会生成自相矛盾的用例。合格标准:能识别矛盾点,不生成逻辑冲突的用例。多轮一致性测试:同一需求反复生成5次,验证核心场景、步骤数量、预期结果的一致性。 反例诱导测试:给出错误的用例示例,验证AI是否会跟随错误规范。合格标准:保持正确的用例设计原则,不被错误示例带偏。质量判定标准:静态审查通过率≥90%,且破坏性验证核心项全部通过,方可入库使用。 1.四类AI应用各自的三个测试重点AI应用类型三个核心测试重点LLMAPI类①输出一致性:固定参数下的输出波动、格式漂移、长文本截断情况②能力基线达标率:推理、知识、代码、安全等核心维度的基准性能③接口可靠性
AI模型的基准测试 在评估一个模型的时候,仅通过ROUGE、BLEU SCORE评价模型还是太单薄了,并不能全面的反馈模型的能力。在相完整评估一个模型的能力的时候,最重要的是提供一套有效的评估模型。 现在常见的模型的基准测试有 GLUE、SuperGLUE、HELM、MMLU等等。 ,如果需要测试模型中文语言能力可以采购这两个模型。 图 3 MMLU 测试结果 清华大学和上海交通大学联合发布了中文 MMLU:C-Eval基准测试。C-Eval包含了13948个多项选择题,涵盖了52个不同的学科和四个难度级别,如图 4 所示。 图 5 2023年 8 月 C-Eval 测试结果 多指标综合基准测试:HELM HELM(Holistic Evaluation of Luaguage Model)从名字上就能看出这是一个以全面评估语言模型的基准测试
系统测试主要包括以下三个方面: 1、项目的整体业务流程 2、真实用户的使用场景 3、数据的流动与正确 4. 接口测试 接口测试是测试系统组件间接口的一种测试。 竞品对比测试 如果有涉及时,可针对做竞品对比测试,清楚优势和劣势。比如AI智能音箱产品。 9. 为此是使用测试集来测试学习器对新样本的差别能力。然后以测试集上的测试误差作为泛化误差的近似。测试人员使用的测试集,只能尽可能的覆盖正式环境用户产生的数据情况。 上线只是完成了一半测试,并不像APP或者WEB网站测试一样,测试通过后,发布到正式环境,测试工作就完成了。 测试人员可以先用算法工程师的测试集进行运行测试查看结果。再通过自己的测试集测试进行指标对比。 测试用例思考点