Views
No views yet
Note: this repo has low accuracy and is under investigation.
| model | precision | wikitext ppl (↓) |
|---|---|---|
| meta-llama/Meta-Llama-3-8B | FP16 | 9.179 |
| yujiepan/Meta-Llama-3-8B-gptq-w4g64 | w4g64 | 10.097 |
1import os
2import torch
3from transformers import AutoModelForCausalLM, AutoTokenizer, GPTQConfig
4
5model_id = "meta-llama/Meta-Llama-3-8B"
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7
8quantization_config = GPTQConfig(
9 bits=4, group_size=64,
10 dataset="c4-new",
11 tokenizer=tokenizer,
12)
13model = AutoModelForCausalLM.from_pretrained(
14 model_id,
15 device_map="auto",
16 low_cpu_mem_usage=True,
17 quantization_config=quantization_config,
18)
19model.push_to_hub('yujiepan/Meta-Llama-3-8B-gptq-w4g64')