评估推理性能的核心指标包括首Token延迟(Time to First Token, TTFT)和每Token生成延迟(Time Per Output Token, TPOT)。TTFT衡量从提交请求到开始输出首个响应Token的等待时间,直接影响用户的交互体验;TPOT反映模型生成每个后续Token的平均耗时,决定完整响应的输出速度。此外,系统支持的最大并发请求数和单卡吞吐量也是关键评估维度。
训练性能主要通过有效算力利用率(Model FLOPS Utilization, MFU)来衡量,即模型实际达到的计算量占加速芯片理论峰值算力的比例。高效的大模型一体机在大规模分布式训练场景下,MFU应能达到较高水平。训练任务的另一个重要指标是端到端完成时间,即在给定硬件配置下完成指定规模模型训练所需的总时长。
资源利用率反映一体机硬件在实际工作负载中的使用效率。优秀的资源调度平台可使GPU平均利用率维持在较高水平,避免算力闲置浪费。能效比则衡量每瓦特功耗所提供的有效算力,对于需要长期运行大模型训练或推理任务的企业而言,更高的能效比意味着更低的电费开支和更少的散热基础设施投入。
企业级应用场景对AI系统的稳定性有严格要求。评估指标包括系统平均无故障运行时间(MTBF)、故障恢复时间(RTO)以及模型服务的可用性百分比。部分一体机还提供冗余硬件设计和自动故障转移机制,当单个加速卡或存储节点发生故障时,系统能够在不中断服务的前提下自动切换至备用资源,保障业务连续性。