Search Results - RepositoryStats

2 results found Sort:

258

2.3k

apache-2.0

SOTA low-bit LLM quantization (INT8/FP8/INT4/FP4/NF4) & sparsity; leading model compression techniques on TensorFlow, PyTorch, and ONNX Runtime

awq fp4 gptq int4 int8 pruning mxformat sparsity sparsegpt auto-tuning smoothquant quantization low-precision large-language-models knowledge-distillation post-training-quantization quantization-aware-training

Created 2020-07-21

3,699 commits to master branch, last one 2 days ago

268

mit

Low Precision Arithmetic Simulation in PyTorch

learning low-precision

Created 2018-07-30

246 commits to master branch, last one 7 months ago