Roy is a fine-tuned large language model based on
mistralai/Mistral-7B-Instruct-v0.2.
1!pip uninstall -y transformers peft accelerate torch safetensors numpy
2!pip install numpy==1.26.4
3!pip install torch==2.2.2
4!pip install transformers==4.41.2
5!pip install peft==0.11.1
6!pip install accelerate==0.30.1
7!pip install safetensors==0.4.3
8
9from transformers import AutoTokenizer, AutoModelForCausalLM
10import torch
11
12# -----------------------------
13# CONFIG
14# -----------------------------
15MODEL_ID = "souvik18/Roy"
16DTYPE = torch.float16 # use float16 for GPU
17
18# -----------------------------
19# LOAD TOKENIZER & MODEL
20# -----------------------------
21print("🔹 Loading tokenizer...")
22tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
23tokenizer.pad_token = tokenizer.eos_token
24
25print("🔹 Loading model...")
26model = AutoModelForCausalLM.from_pretrained(
27 MODEL_ID,
28 torch_dtype=DTYPE,
29 device_map="auto"
30)
31model.eval()
32
33print("\n✅ Model loaded successfully")
34print("Type 'exit' or 'quit' to stop\n")
35
36# -----------------------------
37# CHAT LOOP
38# -----------------------------
39while True:
40 user_input = input("🧑 You: ").strip()
41
42 if user_input.lower() in ["exit", "quit"]:
43 print("👋 Bye!")
44 break
45
46 prompt = f"[INST] {user_input} [/INST]"
47
48 inputs = tokenizer(
49 prompt,
50 return_tensors="pt"
51 ).to(model.device)
52
53 with torch.no_grad():
54 output = model.generate(
55 **inputs,
56 max_new_tokens=200,
57 temperature=0.7,
58 top_p=0.9,
59 do_sample=True,
60 repetition_penalty=1.1,
61 eos_token_id=tokenizer.eos_token_id,
62 )
63
64 response = tokenizer.decode(output[0], skip_special_tokens=True)
65 print(f"\n Roy: {response}\n")