Views
No views yet
1from unsloth import FastLanguageModel
2from transformers import TextStreamer
3
4
5model_path = "mintujohnson/Llama-3.2-3B-French-Instruct"
6model, tokenizer = FastLanguageModel.from_pretrained(model_name = model_path, max_seq_length = 128,
7 dtype = None, load_in_4bit = True)
8
9def inference(messages, model, tokenizer):
10
11 FastLanguageModel.for_inference(model) # Enable native 2x faster inference
12
13
14 inputs = tokenizer.apply_chat_template(
15 messages, tokenize = True,
16 add_generation_prompt = True, # Must add for generation
17 return_tensors = "pt",
18 ).to("cuda")
19 print(tokenizer.decode(inputs[0], skip_special_tokens=False))
20 text_streamer = TextStreamer(tokenizer, skip_prompt = True)
21 _ = model.generate(
22 input_ids = inputs, streamer = text_streamer, max_new_tokens = 128,
23 use_cache = True, temperature = 1.5, min_p = 0.1)
24
25messages = [
26 {"role": "user", "content": "où est la Normandie?"},
27 ]
28output = inference(messages, model, tokenizer)