Views
No views yet
1quantize_config = BaseQuantizeConfig(
2 bits=4,
3 group_size=128,
4 desc_act=False,
5 damp_percent=0.1,
6)1from auto_gptq import AutoGPTQForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")
4model = AutoGPTQForCausalLM.from_quantized("OxxoCodes/Meta-Llama-3-8B-Instruct-GPTQ")
5
6output = model.generate(**tokenizer("The capitol of France is", return_tensors="pt").to(model.device))[0]
7print(tokenizer.decode(output))