Views
No views yet
| Model | MedQA-US Accuracy |
|---|---|
| GPT-4 — Xiong et al. (ACL 2024) | 83.97% |
| Llama 3.3 70B + QLoRA + RAG | 80.99% |
| Llama 3.3 70B + QLoRA (this model) | 78.48% |
| Llama 3.3 70B base | 74.45% |
| GPT-3.5 — Xiong et al. (ACL 2024) | 65.04% |
1from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
2from peft import PeftModel
3import torch
4bnb_config = BitsAndBytesConfig(
5 load_in_4bit=True,
6 bnb_4bit_quant_type="nf4",
7 bnb_4bit_compute_dtype=torch.bfloat16,
8 bnb_4bit_use_double_quant=True,
9)
10tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3.3-70B-Instruct")
11base = AutoModelForCausalLM.from_pretrained(
12 "meta-llama/Llama-3.3-70B-Instruct",
13 quantization_config=bnb_config,
14 device_map="auto",
15)
16model = PeftModel.from_pretrained(base, "martinarra31/medrag-llama33-70b-qlora")
17model.eval()| Parameter | Value |
|---|---|
| LoRA rank | 16 |
| LoRA alpha | 32 |
| Target modules | q, k, v, o, gate, up, down proj |
| Learning rate | 5e-5 |
| LR scheduler | cosine |
| Effective batch size | 64 (1 × 16 grad accum × 4 GPUs) |
| Epochs | 3 |
| Max sequence length | 1024 |
| Quantization | 4-bit NF4 (QLoRA) |