Views
No views yet
quantization_config : {"bits": 4,
"group_size": 128,
"damp_percent": 0.1,
"desc_act": true,
}1from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
2from transformers import AutoTokenizer
3
4model_dir = 'cmeraki/OpenHathi-7B-Hi-v0.1-Base-gptq'
5
6model = AutoGPTQForCausalLM.from_quantized(model_dir, device="cuda:0")
7tokenizer = AutoTokenizer.from_pretrained(model_dir, fast=True)
8tokens = tokenizer("do aur do", return_tensors="pt").to(model.device)
9
10print(tokenizer.decode(model.generate(**tokens, max_length=1024)[0]))