Views
No views yet
unsloth/gpt-oss-20b base model with domain-specific medical knowledge derived from the OpenMed Medical-Reasoning-SFT dataset.unsloth/gpt-oss-20b to function. The adapter implements parameter-efficient fine-tuning through Low-Rank Adaptation (LoRA), enabling efficient inference and deployment on resource-constrained hardware.pip install transformers peft unsloth torch1model, tokenizer = FastLanguageModel.from_pretrained(
2 model_name="hoangtung386/medical-gpt-oss-20b-qlora",
3 max_seq_length=2048,
4 load_in_4bit=True,
5)
6
7FastLanguageModel.for_inference(model)1messages = [
2 {"role": "system", "content": "You are a helpful medical assistant."},
3 {"role": "user", "content": "What are the symptoms of diabetes?"},
4]1prompt = "<|start|>system<|message|>You are a helpful medical assistant.<|end|>"
2prompt += "<|start|>user<|message|>What are the symptoms of diabetes?<|end|>"
3prompt += "<|start|>assistant<|channel|>final<|message|>"
4
5inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
6outputs = model.generate(**inputs, max_new_tokens=256)
7print(tokenizer.decode(outputs[0]))1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4# Load base model
5base_model = AutoModelForCausalLM.from_pretrained(
6 "unsloth/gpt-oss-20b",
7 load_in_4bit=True,
8 device_map="auto"
9)
10
11# Load LoRA adapter
12model = PeftModel.from_pretrained(base_model, "hoangtung386/medical-gpt-oss-20b-qlora")
13tokenizer = AutoTokenizer.from_pretrained("hoangtung386/medical-gpt-oss-20b-qlora")<|start|>system<|message|>...<|end|><|start|>user<|message|>...<|end|><|start|>assistant<|channel|>final<|message|>...<|return|>