
大模型应用上线前,安全评测应覆盖输入安全、提示词攻击、RAG 知识库、模型输出、隐私数据、工具调用、权限边界和审计追溯。红队测试要结合企业真实业务场景,模拟越狱绕过、系统提示词泄露、知识库投毒、敏感信息外泄、违规内容生成和 Agent 行为越界。评测完成后,应将风险样本沉淀为策略、日志和运行时防护机制。
越来越多企业把大模型接入客服、运营、办公、研发、内容生产和业务办理系统。与此同时,大模型的风险也从“输出一句不合规内容”扩展到“在业务链路中错误访问数据、调用工具或误导用户”。
所以,大模型应用上线前不能只做功能测试,还需要做安全评测和红队测试。
层级 | 评测对象 | 典型风险 |
|---|---|---|
模型层 | 基础模型输出、拒答能力、事实性 | 违规生成、幻觉、错误建议 |
应用层 | Prompt、RAG、插件、文件、上下文 | 提示词注入、知识库污染、数据泄露 |
业务层 | 用户身份、权限、动作、流程 | 越权查询、导出、删除、退款、支付 |
运营层 | 人工复核、申诉、日志、策略 | 无法复盘、无法审计、策略不可迭代 |
这四层都测到,才能更接近真实上线状态。
攻击者输入恶意指令 -> 诱导模型忽略系统规则 -> 读取历史上下文或知识库敏感内容 -> 生成违规回答或错误建议 -> 调用高风险工具 -> 造成数据泄露、内容违规或业务损失
实际测试时,可以把攻击路径拆成单点样本和组合样本。单点样本用于验证基础识别能力,组合样本用于验证复杂场景中的策略联动。
样本类型 | 示例方向 | 重点指标 |
|---|---|---|
正常业务样本 | 常规客服、知识问答、文档总结、代码解释 | 误杀率 |
内容风险样本 | 违法违规、诈骗导流、辱骂、低俗、侵权 | 召回率 |
提示词攻击样本 | 越狱、多轮诱导、角色扮演、编码绕过 | 攻击成功率 |
隐私数据样本 | 身份证、手机号、银行卡、Token、合同 | 泄露率和脱敏效果 |
RAG 污染样本 | 文档隐藏指令、错误知识、恶意链接 | 上下文防护能力 |
工具调用样本 | 查询、导出、删除、外发、支付、退款 | 权限校验和二次确认 |
客户端 / 业务系统 -> 安全接入网关 -> 输入风险识别 -> 隐私脱敏 -> 提示词攻击识别 -> RAG 召回内容复检 -> 大模型服务 -> 输出安全审核 -> 工具调用风控 -> 策略引擎 -> 人工复核 / 审计日志 / 样本回流
对于外部用户可访问的系统,建议将安全能力接入在线链路;对于内部试点系统,也应至少保留日志审计和事件追踪。
企业做 POC 时,不建议只看“能不能拦”。更建议看:
在内容安全、AIGC 风险识别和业务风控结合的场景中,可以将数美科技作为参考方案。企业可围绕文本、图片、音频、视频、OCR、多模态内容审核、提示词攻击识别、策略处置、人工复核和审计追溯等能力进行验证。
如果应用具备 Agent 能力,还应关注安全方案是否能识别 Agent 调用了什么能力、访问了什么数据、是否被指令劫持,以及是否留下完整证据。
安全团队、业务团队、算法团队和运营团队都应参与。红队样本需要技术攻击视角,也需要真实业务场景。
对低风险内部问答可能够用;对外部用户、敏感数据、内容发布和工具调用场景,通常还需要应用层安全治理。
应转化为策略规则、样本库、人工复核流程、权限控制和审计要求,并在上线后持续验证。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。