Views
No views yet
google/diffusiongemma-26B-A4B-it, supervised-finetuned on Allen AI's
tmax terminal-agent trajectories
(config skill_tax_20260505_2.2k_combined_balanced_thinking_only_success).| hyperparameter | value |
|---|---|
| LoRA rank / alpha | 64 / 128 |
| target modules | q,k,v,o,gate,up,down |
| canvas length | 256 |
| max completion / prompt | 4096 |
| learning rate | 1.5e-5, cosine, 100 warmup |
| batch (per-device x accum) | 1 x 8 |
| step | 1000 |
| last logged train loss | 0.9125 |
1from peft import PeftModel
2from transformers import AutoTokenizer, DiffusionGemmaForBlockDiffusion
3
4base = DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", torch_dtype="bfloat16", device_map="cuda")
5model = PeftModel.from_pretrained(base, "Rhine-AI/diffusiongemma-26B-A4B-tmax-sft-ckpt1000")
6tok = AutoTokenizer.from_pretrained("Rhine-AI/diffusiongemma-26B-A4B-tmax-sft-ckpt1000")<|im_end|> is ordinary text to
this tokenizer, not an EOS token, so generation does not stop at a turn boundary — use a stop-string.