Views
No views yet


1from unsloth import FastLanguageModel
2
3max_seq_length = 2048
4dtype = None
5load_in_4bit = True
6
7model, tokenizer = FastLanguageModel.from_pretrained(
8 model_name="lakieungocthang/Meta-Llama-3-8B-Fine-tuning",
9 max_seq_length=max_seq_length,
10 dtype=dtype,
11 device_map="auto",
12 load_in_4bit=load_in_4bit,
13)
14
15FastLanguageModel.for_inference(model)
16
17def generate_response_with_question(question, max_tokens=100):
18 prompt = "### Question: {}\n ### Answer: {}"
19 inputs = tokenizer(
20 [prompt.format(question, "")],
21 return_tensors="pt"
22 ).to("cuda")
23
24 outputs = model.generate(**inputs, max_new_tokens=max_tokens, use_cache=True)
25 decoded_output = tokenizer.decode(outputs[0], skip_special_tokens=True)
26
27 answer_index = decoded_output.rfind("### Answer:")
28
29 extracted_text = decoded_output[answer_index + len("### Answer:"):].strip() if answer_index != -1 else decoded_output
30
31 return extracted_text
32
33print(generate_response_with_question("Who is Faker?"))