Views
No views yet
jburtoft/qwen35-deltanet-tkg-fullv2.0-task007, v3.0-training, and v3.1-batched. Pinning to an old
revision here will no longer give you a working kernel — this is deliberate, so that no one
can accidentally load stale code from a retired location.1from kernels import get_kernel
2
3# OLD -- no longer functional at any revision
4# k = get_kernel("jburtoft/qwen35-deltanet-neuron-kernels", revision="v3.1-batched")
5
6# NEW
7k = get_kernel("jburtoft/qwen35-deltanet-tkg-full")KernelConfig module-replacement form:1# OLD
2# KernelConfig({"Qwen3_5GatedDeltaNet": "jburtoft/qwen35-deltanet-neuron-kernels:NeuronGatedDeltaNet"})
3
4# NEW
5KernelConfig({"Qwen3_5GatedDeltaNet": ("jburtoft/qwen35-deltanet-tkg-full", "NeuronGatedDeltaNet")})tkg-full supersedes it on every axis:cache_params, so autoregressive
decode was broken. tkg-full threads recurrent state correctly through decode.(batch, head). tkg-full uses a chunked-parallel kernel batched over all slices in one
launch.torch.compile regression at B >= 2 present in this repo's v3.1-batched is fixed.