Post-Training Quantization (PTQ)
Converting a trained model’s weights to lower-precision formats after training to reduce size and speed up inference.
Converting a trained model’s weights to lower-precision formats after training to reduce size and speed up inference.