Views
No views yet
EvanOLeary/laguna-xs2-dense-k8-cuda-sft-v2 (SFT-extended). Offline RFT on the
SakanaAI/AI-CUDA-Engineer-Archive traces: group ~6 candidate kernels per Task_ID, reward =
recorded CUDA_Speedup_Native gated by Correct, Dr.GRPO group-relative advantage
(r−mean over the task group), KL-to-SFT anchor, DAPO skip zero-variance groups. No live compilation.Off-policy (samples are Sakana's) → group-relative RWR, not on-policy GRPO; uses verified rewards, can't exceed the dataset. Compared vs DPO on KernelBench-Lite L1 (K=4). Lineage/eval: https://github.com/Tyronita/laguna-dense-cuda-kernels