首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏AI资讯

    8个AI测试基准模型介绍和横向对比

    随着AI模型能力的快速演进,基准测试(Benchmark)也从简单的单一维度评估转向多元化的能力测评。本文横向对比8个独立的Benchmark,帮助开发者理解不同基准的定位、适用场景和评测方式。 AI模型评测已从MMLU、GPQA等传统基准,发展到覆盖代码工程、工具使用、对话交互、长程规划、学术推理、实时浏览等维度的精细化评测体系。 8个Benchmark的出现,反映了AI应用场景从"能做什么"向"能做到多好"的演进。 建议:不依赖Solo测试,引入模拟用户交互测试用例。长期决策场景VendingBench2:长期经济决策,ClaudeOpus4.6年度利润$8,017.59。建议:关注策略一致性和资源管理能力。 反映AI应用场景从"知道答案"向"能找到答案"演进。从单智能体到多智能体从单智能体独立任务执行,转向τ²-Bench、VendingBench2等多智能体协作场景评估。

    16210编辑于 2026-09-30
  • 来自专栏小雨的CSDN

    8. 黑盒测试 白盒测试 灰盒测试

    黑盒测试:黑盒测试也称功能测试,测试中把被测的软件当成一个黑盒子,不关心盒子的内部结构是什么,只关心软件的输入数据与输出数据。 白盒测试:白盒测试又称结构测试、透明盒测试、逻辑驱动测试或基于代码的测试。白盒指的打开盒子,去研究里面的源代码和程序结果。 1)逻辑覆盖法:判定法,条件法,判定和判定组合,条件和条件组合,判定和条件组合 2)循环覆盖法:for / while 3)路径覆盖法:switch / try catch 灰盒测试:是介于白盒测试与黑盒测试之间的一种测试 ,灰盒测试多用于集成测试阶段,不仅关注输出、输入的正确性,同时也关注程序内部的情况(集成测试等)

    1.9K30编辑于 2022-10-26
  • AI测试

    AI抢不走测试人的饭碗,但会用AI的测试人,会抢走你的本文来自一个把AI测试真正落地并开源的团队:https://gitee.com/wwcs/ai_test_sheng附在线体验环境:http://111.229.22.12 ✅我们的解法:AI自主探索页面,逆向输出功能点平台内置8阶段AI测试流程,阶段一需求分析、阶段二页面探索:AI用PlaywrightMCP驱动真实浏览器,自动截图、逐元素点击探索,逆向输出完整的功能点清单和元素定位规则 痛点8:AI测试落地成本高,光部署就劝退真实场景:什么?还要配AnthropicKey?还要折腾GPU?门槛直接劝退一票团队。 测试,不如来体验一下真实跑起来的AI测试。 Cron定时任务自动回归,早上看报告7报告整理费时自动生成HTML+Markdown报告+遗漏分析8部署门槛高dockercompose一键部署,可接DeepSeek9团队协作混乱多租户隔离+多会话UUID

    12210编辑于 2026-08-28
  • 来自专栏啄木鸟软件测试

    软件性能测试(连载8)

    snvcswch/s Command 08:18:31 0 1 0.20 0.00 systemd 08:18:31 0 8

    1.2K30发布于 2020-02-19
  • 来自专栏测试开发技术

    到底什么是 AI 测试?AI 测试与传统测试的区别?

    一、先搞清楚:AI测试不是"用AI做测试"那么简单 很多人一听到"AI测试",第一反应是:"哦,就是用ChatGPT、Cursor、Claude Code 这些AI 工具生成测试用例呗。" "我用ChatGPT写过测试用例"——这叫"用AI辅助测试",不叫"AI测试" 2. "我测过公司的大模型产品"——这叫"测试AI系统",是AI测试的一部分 3. 三、AI测试的三种形态:我理解的定义 我认为,AI测试应该包含三个层面,这三个层面构成了一个完整的AI测试能力模型: 形态一:AI辅助测试(AI-Assisted Testing) 定义:用AI工具提升传统测试活动的效率和质量 为了讲清楚AI 测试与传统测试之间的区别,我列了一个对比表,但先声明:这不是"AI测试取代传统测试"的意思,而是"AI测试扩展了传统测试的边界"。 AI测试并不是单纯的传统测试的"升级版",也不是"用AI工具做传统测试"。AI 测试 它是一个新的测试范式,需要新的思维方式、新的评估维度、新的技能栈。 理解这一点,是你转型AI测试的第一步。

    1.3K20编辑于 2026-05-21
  • 软件测试 + AI

    通过结合AI与传统测试方法,企业能够更有效地应对复杂的开发环境,从而提高最终产品的质量和用户满意度。一、软件测试软件测试是软件开发中至关重要的一环,主要目标是查找软件中的缺陷(bug),保障软件质量。 ②作用提高速度和效率缺陷预测与分析③AI应用于软件测试的方式AI通过与测试工程师的互动来增强测试过程。通过输入具体的指令(Prompt),工程师可以指导AI生成所需的测试用例、报告或分析。 ④AI赋能软件测试的具体应用需求评审:AI可以帮助分析需求文档,识别潜在的模糊或不一致之处,提高需求的明确性。测试计划编写:AI可以根据项目需求和历史数据生成测试计划,节省时间并提高效率。 测试用例设计:通过自动生成测试用例,AI能够快速覆盖各种场景,尤其是在面对复杂系统时。测试报告生成:AI能够自动整理测试结果,并生成易于理解的报告,帮助团队做出决策。 自动化测试:AI赋能的自动化测试不仅可以执行重复性测试,还能在代码更新时自动调整测试用例,确保持续集成的有效性。业务代码编写:AI能够协助开发人员编写代码,并提供实时的错误调试和注释建议。

    1.1K21编辑于 2024-09-18
  • 来自专栏啄木鸟软件测试

    精准测试及其工具(连载8)

    星云测试支持两个及以上版本进行对比函数的差异,对比之后列表展示函数变化。如图66和图67。 ? 图66进入“两个版本对比” ? 星云测试支持查看版本对比中修改以及添加代码的函数的覆盖率情况。如图68所示。 ? 图68查看版本对比中修改以及添加代码的函数的覆盖率 2.累计覆盖率 前置条件:工程下至少有两个版本,且这两个版本有覆盖率数据 多版本累计覆盖率是针对多个版本中的所有测试用例的覆盖率的累计,用户以最新版本为基线版本 ,针对之前不同的测试场景累计该版本的覆盖率,从而得出函数的覆盖情况。 图70多版本累计覆盖率 星云测试 http://www.teststars.cc 奇林软件 http://www.kylinpet.com 联合通测 http://www.quicktesting.net

    60922发布于 2019-12-12
  • 来自专栏啄木鸟软件测试

    安全测试工具(连载8)

    lFileWith list of dir/files:选择字典文件,高级用户可以自己书写字典文件 lSelectStarting Option:选择开始选项,包括“标准开始点”和“URL模糊测试”两种方式 建议选择“URL模糊测试”。 lURLto Fuzz—/test.html?url={dir}.asp:如果选择了 “URL模糊测试”, 这里输入/{dir}, 运行时被字典变量替换。 44 DirBuster扫描结果 星云测试 http://www.teststars.cc 奇林软件 http://www.kylinpet.com 联合通测 http://www.quicktesting.net

    88220发布于 2019-12-12
  • 来自专栏码匠的流水账

    java8 parallelStream性能测试

    测试1 @BenchmarkMode(Mode.AverageTime) @OutputTimeUnit(TimeUnit.NANOSECONDS) @Warmup(iterations = 5, time 1509175.840 ns/op StreamBenchTest.benchStream avgt 20 1147570372.950 ± 6138494.414 ns/op 测试 Runtime.getRuntime().availableProcessors() - 1,如果需修改则需设置-Djava.util.concurrent.ForkJoinPool.common.parallelism=8

    1.5K20发布于 2018-09-17
  • 来自专栏小锋学长生活大爆炸

    Web应用程序测试:Web测试的8步指南

    正文开始: ---- Web应用测试:Web测试的8步指南 在我们写下更多关于Web测试类型的细节之前,让我们快速定义Web测试。 二、Web应用测试清单 根据Web测试需求,可以执行以下部分或全部测试类型。 1、功能测试 这是用来检查您的产品是否符合您为其制定的规范,以及您在开发文档中为其制定的功能需求的。 cookie测试将包括 ♦ 测试cookie(sessions)会在缓存清除或过期时被删除。 ♦ 删除cookies(会话),并在下次访问网站时测试登录凭证。 7、安全性测试 对于存储敏感客户信息(如信用卡)的电子商务网站来说,安全测试至关重要。 :Babel Enterprise、BFBTester和CROSS 8、众包测试 您将选择大量的人员(人群)来执行测试,否则将在公司中执行一组特定的人员。

    3.9K21发布于 2020-08-13
  • 来自专栏CSharp编程大全

    8路探测器测试系统

    探测器测试软件设计说明书 1.项目 安检仪探测器测试平台。 2.目的 对探测器采集输出的信息进行处理,测试探测器的性能。 3.功能需求 探测器测试平台框图如图1所示。 图 1探测器测试平台框图 软件功能:求电压直流量(平均值)、噪声均方根值(标准差),样本数在不影响速度的情况下尽量大。 为探测器器3的值……依次对应8个探测器值。 [7][i]); } QChart *chart8 = new QChart(); chart8->addSeries(series8); chart8->legend()->hide (); chart8->createDefaultAxes(); chart8->setTheme(QChart::ChartThemeDark); //方法1 ui.widget8->

    81520发布于 2020-12-15
  • 来自专栏啄木鸟软件测试

    软件安全性测试(连载8)

    <html> <head> <metahttp-equiv="Content-Type" content="text/html;charset=utf-<em>8</em>" /> <scripttype="text/javascript <html> <head> <metahttp-equiv="Content-Type" content="text/html;charset=utf-<em>8</em>"> <title>演示十七:验证码的破解</title

    1.2K20发布于 2019-12-23
  • 来自专栏测试游记

    Java自动化测试(Maven 8)

    MAVEN_HOME=/usr/local/apache-maven-3.6.3 export PATH=$PATH:$MAVEN_HOME/bin 添加后保存 $ source ~/.bash_profile 测试 测试 IDEA中配置 ? IDEA中配置 新建Maven项目 选择新建Maven项目 ? 1 选择存放路径 ? 2 查看项目结构 ? 项目结构 新建存放非代码的文件夹resources ? xml version="1.0" encoding="UTF-8"? >UTF-8</project.reporting.outputEncoding> <! -- 编译时的编码 --> <maven.compiler.encoding>UTF-8</maven.compiler.encoding> <aspectj.version>1.9.2

    1.3K10发布于 2020-07-20
  • 来自专栏啄木鸟软件测试

    单元测试工具(连载8)

    /usr/bin/env python #coding:utf-8 __metaclass_=type class calculator: def__init__(self, a, b): /usr/bin/env python #coding:utf-8 # pip install coverage # coveragerun Calculatortest.py # coveragereport 分别为正数乘正数、正数乘负数、负数乘正数、负数乘负数,参数同test_subs deftest_multiply(self): mydata = [[4,2,8] ,[4,-2,-8],[-4,2,-8],[-4,-2,8]] n=0 judge=True for i in ), (4,-2,-8,), (-4,2,-8,), (-4,-2,8,), ])

    78710发布于 2019-12-12
  • 来自专栏ThoughtWorks

    AI测试的迷思

    在这些测试社区和社群中,我遇到了许多关于AI测试的问题,例如什么是AI测试,如何进行AI测试,AI测试有哪些工具与方法等。 然而,当我在网上搜索AI测试相关的书籍时,却发现大量的AI开发相关书籍,却鲜有专门介绍AI测试的书籍。这说明测试业界仍在混沌中不断摸索前进。 AI测试的迷思 在讨论AI测试时,通常存在两种理解: 第一种是利用AI辅助当前的软件测试,例如使用AI系统学习测试分析和测试设计,进而自动生成测试用例并自动化实现这些测试用例。 因此,AI辅助测试仍有很长的路要走。 第三个问题:哪些软件系统能用AI辅助测试? 理论上,任何软件系统都可以使用AI来辅助自动化测试工作。 总结 通过上面对于问题的回答,希望能解决大家对于AI测试的困惑,包括了解什么是AI测试,自己的项目是否适合使用AI测试,以及未来是否需要在AI测试上投资等问题。

    66920编辑于 2023-04-28
  • 来自专栏软件测试

    如何测试AI幻觉?

    那一刻,我知道自己需要系统性地学会一件事:如何测试AI幻觉。一、先搞清楚你在测什么"幻觉"这个词,在AI领域被用得太宽泛了。 测试集的设计需要特别关注三类场景:知识边界场景:主动测试AI知识截止日期附近的事实,以及它可能不熟悉的专业领域知识。 测试方法:给AI提供一段明确的参考文档,然后问与文档内容相关的问题,再用独立的评估器(或人工)逐条核验:AI的每一个陈述,能不能在提供的文档里找到明确的依据? 这个结构,比单轮问答测试要复杂得多,但它测到的是AI在真实使用场景下的真实行为。 (如"美托洛尔"vs"美托洛尔琥珀酸盐")的剂量差异问超出AI应该回答的范围的问题(如"帮我直接开一个处方")——测试AI能否正确识别边界并拒绝第3层:对话一致性集(Consistency Set)设计多轮对话测试树

    39010编辑于 2026-07-04
  • 来自专栏决策智能与机器学习

    如何测试AI系统?

    简而言之,您不会像对其他项目进行质量检查那样对AI项目进行质量检查。这是因为对于AI项目而言,我们要测试的内容,测试方式以及测试时间的概念大不相同。 在AI的训练和推理阶段进行测试和质量保证,那些有机器学习模型训练经验的人都知道测试实际上是使AI项目正常工作的核心要素。您不仅可以开发AI算法,还可以将训练数据投入其中。 完成此操作后,您可以返回并使用其他预留测试数据来验证模型是否确实按预期工作。尽管这是测试和验证的所有方面,但它发生在AI项目的训练阶段。这是在AI模型投入运行之前。 这意味着,如果您不是从头开始编写代码,那么就实际代码而言,几乎没有什么要测试的-假设算法已经通过了测试。在AI项目中,假设已按照预期实施了QA,则质量检查将永远不会专注于AI算法本身或代码。 您需要测试将AI模型投入生产的代码-AI系统的操作组件。这可能会在AI模型投入生产之前发生,但是实际上您并没有在测试AI模型。相反,您正在测试使用该模型的系统。

    1.9K10发布于 2020-08-04
  • 来自专栏ceshiren0001

    避免误判:用 n8n 打造你的 AI 输出安全测试防护盾

    问题并不在于AI不够聪明,而恰恰是我们缺乏一套持续、自动化的机制,来检验AI的输出是否可靠。正因如此,构建一套AI输出安全测试系统,不应只是事后的补救,而必须成为开发流程中不可或缺的一环。 今天,我想与你分享一种基于n8n的解决方案——这个工具你可能熟悉,但它在保障AI安全方面的潜力,或许才刚刚被看见。为什么选择n8n? 更重要的是,n8n的自托管特性意味着你的测试数据永远不会离开你的基础设施,这对于处理敏感信息的AI系统至关重要。 它的扩展性也令人印象深刻——我们团队曾用单个n8n实例同时监控17个不同的AI模型输出,每天处理超过50万条测试。构建你的第一个AI输出安全测试工作流环境准备首先,确保你有一个运行中的n8n实例。 :对于高频使用的AI服务,考虑将n8n工作流部署在靠近AI服务的区域以减少延迟结论:主动而非被动构建AI输出安全测试护盾不是一次性的项目,而是一个持续的过程。

    52810编辑于 2025-12-04
  • 来自专栏软件测试学习

    AI教你学测试

    ChatGPT这个词相信大家最近看到都不会陌生,应该刷爆了各位的朋友圈,各种分享注册教程、什么AI写代码的文章比比皆是,今天,让我们一起来看一下OpenAI能不能教我们学测试呢,对测试人员的日常工作是否有帮助呢 二、AI智能对话初体验 注册账号后,通过对话,我们来看一下AI会教我们怎么去学测试呢? 怎么判断自己目前是否适合转行做测试? 软件测试的基本流程是什么? 数据库怎么去学? 测试环境怎么搭建? 自动化框架的设计思路? 测开要具备哪些技能? 面试时怎么谈薪资? 印象深刻的bug? 接口幂等什么意思? 自动化测试的高频面试题 如何在团队中推广自动化测试? UI自动化定位不到元素有哪些原因? 看到这,你是不是以为AI是万能的呢?

    95020编辑于 2023-02-24
  • AI+精准测试

    什么是精准测试精准测试主要解决测试分析以及测试执行两个维度的问题,作为QA团队,变更的输入主要来源两方:一方是来自业务产品侧的业务变更,一方是研发侧的代码变更。 如何在需求/代码变更后快速准确的评估测试范围,高效召回并执行用例,最终通过覆盖率等量化指标评估测试效果是精准测试主要的价值体现。 AI+精准测试能做什么充分发挥LLM在信息理解以及生成方面的能力优势,LLM将原本干枯的系统链路信息,结合技术文档,API文档生成可读性更好的节点信息摘要;将召回的繁杂冗长的用例信息通过LLM进行信息摘要后变的可读性更好 IM通知AI+精准测试能力升级LLM基于变更方法,系统链路以及召回用例信息输出测试建议。 开发精准测试SKILL,可本地AIIDE和远程claw触发和执行精准测试流程-开发中。

    27200编辑于 2026-06-01
领券