ps. 12 Hours from T4 Kaggle
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "Konthee/Llama-3.1-8B-ThaiInstruct"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id, torch_dtype="auto", device_map="auto"
8)
9
10messages = [
11 {"role": "user", "content": "สอนภาษาไทยหน่อย"},
12]
13
14input_ids = tokenizer.apply_chat_template(
15 messages, add_generation_prompt=True, return_tensors="pt"
16).to(model.device)
17
18outputs = model.generate(
19 input_ids,
20 max_new_tokens=4096,
21 do_sample=True,
22 temperature=0.6,
23 top_p=0.9,
24)
25response = outputs[0][input_ids.shape[-1]:]
26print(tokenizer.decode(response, skip_special_tokens=True))
This llama model was trained 2x faster with
Unsloth and Huggingface's TRL library.