Views
No views yet
1import torch
2
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5model_id = "irlab-udc/Llama-3.1-8B-Instruct-Galician-GPTQ-Int4"
6
7tokenizer = AutoTokenizer.from_pretrained(model_id)
8
9model = AutoModelForCausalLM.from_pretrained(
10 model_id,
11 torch_dtype=torch.float16,
12 low_cpu_mem_usage=True,
13 device_map="auto"
14)
15
16messages = [
17 {"role": "system", "content": "You are a conversational AI that responds in Galician."},
18 {"role": "user", "content": "Cal é a principal vantaxe de Scrum?"},
19]
20
21inputs = tokenizer.apply_chat_template(
22 messages,
23 tokenize=True,
24 add_generation_prompt=True,
25 return_tensors="pt",
26 return_dict=True,
27).to("cuda")
28
29outputs = model.generate(**inputs, do_sample=True, max_new_tokens=512)
30
31print(tokenizer.batch_decode(outputs, skip_special_tokens=True))