Views
No views yet
| Parameter | Value |
|---|---|
| Base model | Qwen/Qwen3-8B |
| Method | Supervised Fine-Tuning |
| Dataset | OpenMed/Medical-Reasoning-SFT-GPT-OSS-120B-V2 |
| LoRA rank | 32 |
| Learning rate | 0.00024000000000000003 |
| Steps | 200 |
| Final loss | 0.824262 |
| Tinker sampler path | tinker://c4696b77-8fac-53f5-bd72-78d408c9a9ca:train:0/sampler_weights/clawpathy-10bd1452-be1-final |
| Tinker state path | tinker://c4696b77-8fac-53f5-bd72-78d408c9a9ca:train:0/weights/clawpathy-10bd1452-be1-state |