Views
No views yet
| Field | Value |
|---|---|
| Base model | Qwen/Qwen2.5-Math-7B |
| Adaptation | LoRA adapters, rank 64 on linear layers |
| Training algorithm | GRPO |
| Variant label | D_OracleAug |
| Loss mode | mse |
Auxiliary weight alpha | 0.001 |
| Expert pool / data | Oracle-augmented v2 expert pool: 12,317 traces = 8,963 self + 3,354 filtered Oracle. |
| Training steps | 2,000 RL optimizer steps |
| Evaluation prompt path | base-model cot-4shot |
| W&B run id | yg079tgl |
| W&B project | lavida-mvm |
psi = [h_start || h_end || h_mean || delta_H] in R^14336 for LaViDA variants.256 for auxiliary branches.| Metric | Value |
|---|---|
Greedy overall (T=0) | 76.2% |
n=8 mean correctness (T=0.6) | 79.57% |
| pass@8 | 80.2% |
| L4-5 pass@8 | 69.47% |
| Level-5 pass@8 | 61.19% |
Pritish92/lavida-variant-A-seed0-a-2000Pritish92/lavida-variant-B-seed0-oracleaug-alpha0p2Pritish92/lavida-variant-D-seed0-oracleaug-alpha0p001Pritish92/lavida-variant-B-seed0-selfdistill-alpha0p021from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_id = "Qwen/Qwen2.5-Math-7B"
5adapter_id = "Pritish92/lavida-variant-D-seed0-oracleaug-alpha0p001"
6
7tokenizer = AutoTokenizer.from_pretrained(base_id, trust_remote_code=True)
8base = AutoModelForCausalLM.from_pretrained(base_id, trust_remote_code=True, device_map="auto")
9model = PeftModel.from_pretrained(base, adapter_id)
10model.eval()cot-4shot evaluation path used in the LaViDA experiments for comparable MATH-500 numbers.A_2000 vs D_OracleAug replication target is still seed 1.D_OracleAug).1@misc{saha2026lavidadoracleaug,
2 title = {LaViDA Variant D Seed-0 OracleAug alpha=0.001},
3 author = {Saha, Pritish},
4 year = {2026},
5 url = {https://huggingface.co/Pritish92/lavida-variant-D-seed0-oracleaug-alpha0p001}
6}