Views
No views yet
huzaifa1117/tinyllama_AWQ_4bit model with quantization for efficient computation on CUDA devices.pip install torch transformers peft awq1from transformers import (
2 AutoModelForCausalLM,
3 AutoTokenizer,
4 HqqConfig
5)
6from peft import PeftModel
7import torch
8from awq import AutoAWQForCausalLM
9
10# Use CUDA if available
11device = torch.device("cuda")
12
13# Model ID and quantization configuration
14model_id = "huzaifa1117/tinyllama_AWQ_4bit"
15quant_config = HqqConfig(nbits=1, group_size=64, quant_zero=False, quant_scale=False, axis=1)
16
17# Load the tokenizer
18tokenizer = AutoTokenizer.from_pretrained(model_id)
19
20# Load the model with quantization on CUDA
21model = AutoAWQForCausalLM.from_pretrained(model_id, low_cpu_mem_usage=True, use_cache=False, device_map='cuda')
22
23# Move the model to the CUDA device
24model.to(device)
25
26# Tokenize input and run inference
27input_text = "Your input text here"
28input_ids = tokenizer(input_text, return_tensors="pt").input_ids.to(device)
29output = model.generate(input_ids, max_length=50)
30
31# Decode and print the output
32output_text = tokenizer.decode(output[0], skip_special_tokens=True)
33print(output_text)HqqConfig to apply 1-bit quantization for all linear layers, ensuring high performance on resource-constrained hardware:quant_config = HqqConfig(nbits=1, group_size=64, quant_zero=False, quant_scale=False, axis=1)