| bits | 4 |
| group_size | 128 |
| damp_percent | 0.01 |
| desc_act | false |
| sym | true |
| true_sequential | true |
| static_groups | false |
| format | safetensors, fp16 |
wikitext / wikitext-2-raw-v1, train splitexamples/quantization/basic_usage_wikitext2.py from AutoGPTQ1from auto_gptq import AutoGPTQForCausalLM
2from transformers import AutoTokenizer
3
4repo = "fmlini251/Llama-3.1-8B-GPTQ-4bit-128g"
5tokenizer = AutoTokenizer.from_pretrained(repo)
6model = AutoGPTQForCausalLM.from_quantized(repo, device="cuda:0", use_triton=False)LICENSE and USE_POLICY.md in this repository.