平台在网关层对输入做校验与护栏(Guardrails),明确 Agent 与模型可执行的边界,防止提示词注入(Prompt Injection)诱导模型越权或泄露敏感信息。
在模型原始输出送达用户前,平台对有害、违规、不准确或不符合策略的内容进行过滤与拦截,形成"模型输出—安全层—用户可见"的防护链。
对涉及个人敏感信息(PII)的内容做识别与脱敏;对超出知识范围或合规禁区的问题执行拒答或转人工,降低幻觉与违规风险。
平台记录每次调用的身份、时间戳、模型版本、Token 消耗与触发的过滤动作,形成可审计链路,满足金融、医疗等强监管行业的合规留存要求。