Views
No views yet
1from unsloth import FastLanguageModel
2
3model, tokenizer = FastLanguageModel.from_pretrained(
4 model_name = "rafkus/gemma4-cs-q8_0",
5 max_seq_length = 2048,
6 load_in_4bit = True,
7)
8
9FastLanguageModel.for_inference(model)
10
11messages = [
12 {"role": "system", "content": "Kamu adalah asisten customer service yang profesional dan ramah bernama Purwa."},
13 {"role": "user", "content": "Halo, saya mau tanya status pesanan saya nomor #INV20240115"},
14]
15
16inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to("cuda")
17outputs = model.generate(inputs, max_new_tokens=256)
18print(tokenizer.decode(outputs[0]))ollama run rafkus/gemma4-cs-q8_0