Views
No views yet
| model | precision | wikitext ppl (↓) |
|---|---|---|
| meta-llama/Meta-Llama-3-8B-Instruct | FP16 | 10.842 |
| yujiepan/Meta-Llama-3-8B-Instruct-awq-w4g64 | w4g64 | 10.943 |
1from awq import AutoAWQForCausalLM
2model = AutoAWQForCausalLM.from_quantized('yujiepan/Meta-Llama-3-8B-awq-w4g64-Instruct')1from awq import AutoAWQForCausalLM
2from transformers import AutoTokenizer
3
4model_path = "meta-llama/Meta-Llama-3-8B-Instruct"
5quant_config = {"zero_point": True, "q_group_size": 64, "w_bit": 4, "version": "GEMM"}
6
7model = AutoAWQForCausalLM.from_pretrained(model_path)
8tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)
9model.quantize(tokenizer, quant_config=quant_config)