fused_dense_lib CUDA extension from csrc/fused_dense_lib of the
odysseyml/flash-attention fork.
Backs flash_attn.modules.mlp.FusedMLP: linear_bias_wgrad, linear_act_forward, bias_act_linear_dgrad_bgrad.build-fused-dense-matrix.yml workflow
(release fused-dense-matrix-1) and repackaged here in kernels layout.1from kernels import get_kernel
2
3fused_dense_lib = get_kernel("odyssey-systems/fused-dense-lib")