Views
No views yet
1from peft import AutoPeftModelForCausalLM
2from transformers import AutoTokenizer
3model = AutoPeftModelForCausalLM.from_pretrained(
4 "nordenxgt/nelm-chat-unsloth-llama3-v.0.0.1"
5 load_in_4bit=True
6)
7tokenizer = AutoTokenizer.from_pretrained("nordenxgt/nelm-chat-unsloth-llama3-v.0.0.1")1from unsloth import FastLanguageModel
2model, tokenizer = FastLanguageModel.from_pretrained(
3 model_name="nordenxgt/nelm-chat-unsloth-llama3-v.0.0.1",
4 max_seq_length=2048,
5 dtype=None,
6 load_in_4bit=True,
7)
8FastLanguageModel.for_inference(model)1alpaca_prompt = """Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.
2
3### Instruction:
4{}
5
6### Input:
7{}
8
9### Response:
10{}"""
11
12inputs = tokenizer(
13[
14 alpaca_prompt.format(
15 "गौतम बुद्धको जन्म कुन देशमा भएको थियो?" # instruction
16 "", # input
17 "", # output - leave this blank for generation!
18 )
19], return_tensors = "pt").to("cuda")
20
21outputs = model.generate(**inputs, max_new_tokens=64, use_cache=True)
22tokenizer.batch_decode(outputs)