<user>
{instruction}
</user>
<assistant>
{response}
<user>
{instruction}
</user>
<assistant>
{response}
Used in chosen-vs-rejected pair format.
<user>
{your_message}
</user>
<assistant>
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_dir = "Nexura-gemma2b-sft-dpo"
5
6tokenizer = AutoTokenizer.from_pretrained(model_dir)
7model = AutoModelForCausalLM.from_pretrained(model_dir, device_map="auto")
8
9prompt = "<user>\nExplain recursion.\n</user>\n\n<assistant>\n"
10
11inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
12
13output = model.generate(
14 **inputs,
15 max_new_tokens=256,
16 do_sample=False,
17 repetition_penalty=1.3,
18 no_repeat_ngram_size=4
19)
20
21print(tokenizer.decode(output[0], skip_special_tokens=True))
curl -X POST http://localhost:8000/api/chat \
-H "Content-Type: application/json" \
-d '{"messages":[{"role":"user","content":"hi"}]}'
@misc{nexura_gemma2b_2025,
title={Nexura-Gemma-2B},
model={Custom fine-tuned Gemma-2B},
author={Arun Vpp},
year={2025},
publisher={Hugging Face}
}
This README is fully compatible with Hugging Face’s metadata requirements.
Just paste it into your README.md — no modification needed.