GemSUra-edu is a large language model fine-tuned on a dataset of FAQs from HCMUT, based on the pre-trained model
GemSUra 2B developed by the URA research group at Ho Chi Minh City University of Technology (HCMUT).
1from unsloth import FastLanguageModel
2import torch
3
4# Load model and tokenizer
5model, tokenizer = FastLanguageModel.from_pretrained(
6 model_name="IAmSkyDra/GemSUra-edu",
7 max_seq_length=4096,
8 dtype=None,
9 load_in_4bit=True
10)
11
12FastLanguageModel.for_inference(model)
13
14query_template = "<start_of_turn>user\n{query}<end_of_turn>\n<start_of_turn>model\n"
15
16while True:
17 query = input("Query: ")
18 if query.lower() == "exit":
19 break
20
21 query = query_template.format(query=query)
22 inputs = tokenizer(query, return_tensors="pt")
23
24 outputs = model.generate(**inputs, max_new_tokens=4096, use_cache=True)
25 generated_text = tokenizer.batch_decode(outputs, skip_special_tokens=True)
26 answer = generated_text[0].split("model\n")[1].strip()
27 print(answer)
1import transformers
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4pipeline_kwargs = {
5 "temperature": 0.1,
6 "max_new_tokens": 4096,
7 "do_sample": True
8}
9
10if __name__ == "__main__":
11 # Load model
12 model = AutoModelForCausalLM.from_pretrained(
13 "IAmSkyDra/GemSUra-edu",
14 device_map="auto"
15 )
16 model.eval()
17
18 # Load tokenizer
19 tokenizer = AutoTokenizer.from_pretrained(
20 "IAmSkyDra/GemSUra-edu",
21 trust_remote_code=True
22 )
23
24 pipeline = transformers.pipeline(
25 model=model,
26 tokenizer=tokenizer,
27 return_full_text=False,
28 task='text-generation',
29 **pipeline_kwargs
30 )
31
32 query_template = "<start_of_turn>user\n{query}<end_of_turn>\n<start_of_turn>model\n"
33
34 while True:
35 query = input("Query: ")
36 if query.lower() == "exit":
37 break
38
39 query = query_template.format(query=query)
40 answer = pipeline(query)[0]["generated_text"]
41 answer = answer.split("model\n")[1].strip()
42 print(answer)
If you want to quantize the model for deployment on local devices, it should be quantized to at least 8 bits.