量化是通过对值精度维度压缩,把神经网络中参数存储格式从FP32-32位浮点降低为更低精度表示(FP16-16位浮点、INT8-8位定点整数、INT4-4位定点整数)数值格式,在线上推理时再通过反量化(恢复回