1from unsloth import FastLanguageModel
2import torch
3
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name="unsloth/Qwen2.5-7B-Instruct",
6 load_in_4bit=True,
7)
8
9from peft import PeftModel
10model = PeftModel.from_pretrained(model, "usurachai/zendesk-support-qwen2.5-7b-lora")
11
12# Inference
13messages = [
14 {"role": "system", "content": "You are a helpful, polite customer support agent for a Thai company. Respond in Thai."},
15 {"role": "user", "content": "สั่งของไปแล้วยังไม่ได้รับเลยครับ"},
16]
17inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to("cuda")
18outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.9)
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))
The dataset was exported from Zendesk via Sunshine Conversations, cleaned and deduplicated with: