Volume VIII

Quantization

Reducing model precision for efficient inference: INT8, INT4, GPTQ, AWQ, SmoothQuant, and quantization-aware training.

12 chapters published