Views
No views yet
Laguna-XS.2 MoE → densify → warm-start → recon (kernel mix)
→ SFT (level_1+2) = cuda-sft
→ SFT-extended (level_1+2+3) = cuda-sft-v2
→ RFT / GRPO = THIS MODEL~[-0.2, 1.0]): +0.1 parsed · +0.2 compiles · +0.4 numerically correct · +0.3·clip(speedup,0,3)/3.r−mean, no length/std normalization) +
DAPO dynamic sampling (skip zero-variance groups) + KL-to-SFT anchor (β=0.02). RLVR — reward
is verification, not a learned model.| Base | cuda-sft-v2 |
| Prompts | verifiable elementwise ops (relu/sigmoid/tanh/gelu/silu/softplus) — auto-checkable vs eager |
| Group size | 6 · steps 24 · lr 1e-6 · KL β 0.02 · temp 0.9 |
| Trainable | routed_dense + lm_head |
SFT → SFT-extended → RFT.
Compile-rate / correctness / speedup lift table:
github.com/Tyronita/laguna-dense-cuda-kernels.Scope: the verifiable reward covers the elementwise op set (numerically checkable vs eager) — a subset of KernelBench L1. Honest about what RL optimized.