Views
No views yet
trained for only 700 steps, -> 1.75 epochs (so the output may not be good enough to call it a good model)
1from transformers import StoppingCriteria, StoppingCriteriaList
2from unsloth import FastLanguageModel
3import torch
4
5hf_token = "<Your-hf-token>"
6max_seq_length = 2048 # Choose any! We auto support RoPE Scaling internally!
7dtype = None # None for auto detection. Float16 for Tesla T4, V100, Bfloat16 for Ampere+
8load_in_4bit = True # Use 4bit quantization to reduce memory usage. Can be False.
9
10model, tokenizer = FastLanguageModel.from_pretrained(
11 model_name = "Someman/Indic-gemma-2b-finetuned-sft-Navarasa-adapters-ne-v1.0",
12 max_seq_length = max_seq_length,
13 dtype = dtype,
14 load_in_4bit = load_in_4bit,
15 token=hf_token
16)
17
18
19FastLanguageModel.for_inference(model)
20alpaca_prompt = """
21### Instruction:
22{}
23
24### Input:
25{}
26
27### Response:
28{}"""
29
30
31
32inst = "LinkedIn मा कसरी बढ्ने? ५ अंकमा व्याख्या गर्नुहोस्"
33input = ""
34
35inputs = tokenizer(
36[
37 alpaca_prompt.format(
38 inst, # instruction
39 input, # input
40 "", # output - leave this blank for generation!
41 )
42], return_tensors = "pt").to("cuda")
43
44# since we use packing = True it starts generating another similar sample starting with <bos>. So we are using eos_token_id = tokenizer.bos_token_id
45outputs = model.generate(**inputs, max_new_tokens = 800, use_cache = True)
46result = tokenizer.batch_decode(outputs)[0]
47print (result)