平台记录每次请求的用户查询、检索查询、送入模型的完整提示词、原始输出、解析结果与护栏动作,作为问题定位的基础数据。
除传统系统指标(延迟、吞吐、资源利用率)外,平台追踪 LLM 特有的 Token 消耗、调用成功率、错误码分布(如 429 限流、5XX)与首包时延,并以大盘呈现整体水位与异常分布。
基于 OpenTelemetry 等标准,平台对请求在预处理、向量检索、重排、模型调用、后处理之间的全链路做端到端追踪,快速定位瓶颈环节。
平台支持阈值告警、异常检测与趋势告警,对高延迟、检索召回下降、幻觉率上升等异常主动通知;并通过版本对比、影子部署识别模型回归,保障生产稳定性。