Views
No views yet
| Parameter | Value |
|---|---|
| Method | Method B - Dequantized model LoRA extraction |
| Base Model | Qwen/Qwen3-32B (dequantized BF16) |
| Fine-tuned Model | biomni/Biomni-R0-32B-Preview |
| Rank (r) | 256 |
| Alpha | 256 |
| Target Modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Extraction Tool | MergeKit (mergekit-extract-lora) |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4# Load base model
5base_model = AutoModelForCausalLM.from_pretrained(
6 "Qwen/Qwen3-32B",
7 device_map="auto",
8 torch_dtype="auto",
9 trust_remote_code=True
10)
11
12# Load LoRA adapter
13model = PeftModel.from_pretrained(base_model, "hassanshka/Biomni-R0-32B-LoRA-Dequantized-Rank256")
14tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-32B")
15
16# Inference
17messages = [{"role": "user", "content": "Your biomedical question here"}]
18inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
19outputs = model.generate(inputs, max_new_tokens=512)
20print(tokenizer.decode(outputs[0]))1from vllm import LLM, SamplingParams
2
3llm = LLM(
4 model="Qwen/Qwen3-32B",
5 enable_lora=True,
6 max_lora_rank=256
7)
8
9# Load LoRA at runtime
10output = llm.generate(
11 prompts,
12 lora_request=LoRARequest("biomni", 1, "hassanshka/Biomni-R0-32B-LoRA-Dequantized-Rank256")
13)1# Step 1: Dequantize the base model (see dequant script in extraction_scripts/)
2# Step 2: Extract LoRA
3mergekit-extract-lora \
4 --model "biomni/Biomni-R0-32B-Preview" \
5 --base-model "./dequantized_bf16_model" \
6 --out-path "./lora_output" \
7 --max-rank 256 \
8 --device cuda