Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "zzzmahesh/Meta-Llama-3-8B-Instruct-quantized.w4a4"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 device_map="auto",
9 low_cpu_mem_usage=True
10)
11
12prompt = "What are the benefits of model quantization in AI?"
13inputs = tokenizer(prompt, return_tensors="pt")
14outputs = model.generate(**inputs)
15
16print(tokenizer.decode(outputs[0]))1from transformers import AutoTokenizer
2from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
3import random
4
5model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
6
7# Create random examples for quantization calibration
8num_samples = 256
9max_seq_len = 8192
10tokenizer = AutoTokenizer.from_pretrained(model_id)
11max_token_id = len(tokenizer.get_vocab()) - 1
12examples = [{"input_ids": [random.randint(0, max_token_id) for _ in range(max_seq_len)], "attention_mask": max_seq_len * [1]} for _ in range(num_samples)]
13
14# Define quantization configuration for W4A4
15quantize_config = BaseQuantizeConfig(bits=4, group_size=-1, desc_act=True, model_file_base_name="model", damp_percent=0.01)
16
17# Load and quantize the model
18model = AutoGPTQForCausalLM.from_pretrained(model_id, quantize_config, device_map="auto")
19model.quantize(examples)
20model.save_pretrained("Meta-Llama-3-8B-Instruct-quantized.w4a4")