Search Results - RepositoryStats

266

2.4k

apache-2.0

32

SOTA low-bit LLM quantization (INT8/FP8/INT4/FP4/NF4) & sparsity; leading model compression techniques on TensorFlow, PyTorch, and ONNX Runtime

awq fp4 gptq int4 int8 pruning mxformat sparsity sparsegpt auto-tuning smoothquant quantization low-precision large-language-models knowledge-distillation post-training-quantization quantization-aware-training

Created 2020-07-21

3,759 commits to master branch, last one a day ago

74

494

apache-2.0

5

Production ready LLM model compression/quantization toolkit with hw accelerated inference support for both cpu/gpu via HF, vLLM, and SGLang.

gptq peft vllm sglang optimum quantization transformers

Created 2024-06-17

2,156 commits to main branch, last one 24 hours ago

24

446

mit

33

Large Language Models for All, 🦙 Cult and More, Stay in touch !

gpt llm ggml gpt4 gptq llama alpaca vicuna chatgpt loralib pytorch deepspeed tensorflow transformers

Created 2023-03-30

27 commits to main branch, last one about a year ago

35

438

apache-2.0

12

Advanced Quantization Algorithm for LLMs/VLMs.

awq gptq int4 rounding quantization neural-compressor

Created 2024-01-04

471 commits to main branch, last one a day ago

21

400

apache-2.0

4

🦖 X—LLM: Cutting Edge & Easy LLM Finetuning

gpt llm gptq gpt-4 llama torch alpaca llama2 openai vicuna zephyr chatgpt mistral pytorch cerebras bitsandbytes deep-learning deep-neural-networks large-language-models

Created 2023-11-10

62 commits to main branch, last one about a year ago