Views
No views yet
Qwen/Qwen3.6-35B-A3B fine-tuned with a LoRA SFT run on the aisamdasu/algocean-fable5-traces trace mix.3600, which had the lowest validation loss in the training run.llama-cli -m Algocean-Qwen3.6-35B-A3B.gguf -p "Create a concise LangGraph plan for a repo refactor." -n 512| item | value |
|---|---|
| Format | GGUF F16 |
| File | Algocean-Qwen3.6-35B-A3B.gguf |
| File size | 71,066,993,920 bytes |
| GGUF version | 3 |
| GGUF metadata keys | 43 |
| GGUF tensors | 753 |
| LoRA tensors merged | 20 |
| SHA-256 | 564448e3c3861fd9f143bba4311c4a3cdc92da6709099fa25d5ed1cc0a4c3e89 |
| key | value |
|---|---|
| Base model | Qwen/Qwen3.6-35B-A3B |
| Dataset | aisamdasu/algocean-fable5-traces |
| Train / eval rows | 30,265 / 512 |
| Selected source rows | Crownelius 26,938 + kelexine 3,839 |
| Dedup skipped | 1,721 |
| Fine-tune method | LoRA SFT |
| LoRA target modules | q_proj, v_proj |
| LoRA rank / alpha / dropout | 16 / 32 / 0.0 |
| Max sequence length | 16,384 |
| Optimizer / schedule | AdamW fused / cosine |
| Learning rate / warmup | 1e-5 / 0.03 |
| Batch / grad accumulation | 1 / 1 |
| Max steps | 4,000 |
| Eval / save interval | 200 / 200 |
| GPU | Modal B200 x1 |
| Runtime | 7,934.71 sec |
| step | eval loss | eval PPL | note |
|---|---|---|---|
| 200 | 1.300712 | 3.671911 | first eval |
| 3200 | 1.067631 | 2.908480 | near plateau |
| 3400 | 1.067996 | 2.909543 | regression |
| 3600 | 1.066911 | 2.906388 | selected best |
| 3800 | 1.067495 | 2.908084 | worse than best |
| 4000 | 1.067005 | 2.906661 | final, slightly worse |
3600 has the lowest validation loss: 1.066911.4000 is very close but still higher: +0.000094 eval loss.3200, so selecting 3600 keeps the best validation point without chasing extra train loss.


| metric | value |
|---|---|
| Best eval loss | 1.066911 |
| Best eval perplexity | 2.906388 |
| Final eval loss | 1.067005 |
| Final eval perplexity | 2.906661 |
| Trainer average train loss | 0.494604 |
| Last logged train loss | 0.996137 |
| Train samples/sec | 0.504 |
| Train steps/sec | 0.504 |
| Eval samples/sec at final eval | 2.088 |
3600 is the lowest-loss point among all saved checkpoints.