Views
No views yet
| model | precision | wikitext ppl (↓) |
|---|---|---|
| meta-llama/Meta-Llama-3-8B-Instruct | FP16 | 10.842 |
| yujiepan/Meta-Llama-3-8B-Instruct-gptq-w8asym | int8-asym | 10.854 |
1from awq import AutoAWQForCausalLM
2model = AutoAWQForCausalLM.from_quantized('yujiepan/Meta-Llama-3-8B-Instruct-gptq-w8asym')1import os
2import torch
3from transformers import AutoModelForCausalLM, AutoTokenizer, GPTQConfig
4
5model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7
8quantization_config = GPTQConfig(
9 bits=8, group_size=-1,
10 dataset="c4-new",
11 sym=False,
12 tokenizer=tokenizer,
13 use_cuda_fp16=True,
14)
15model = AutoModelForCausalLM.from_pretrained(
16 model_id,
17 device_map="auto",
18 low_cpu_mem_usage=True,
19 quantization_config=quantization_config,
20)