Views
No views yet
| Model | Architecture | Params | Val PPL |
|---|---|---|---|
| F0 | Transformer (unfactored) | 1,364M | 25.4 |
| F1 | Transformer + factored | 515M | 37.6 |
| DN-F1 | Gated DeltaNet + factored | 1,236M | 22.2 |
| DeltaLens | DeltaLens + factored | 751M | 19.01 |
checkpoints/deltalens-751m/model.safetensors -- unfactored weights, ready to load:1from safetensors.torch import load_file
2from src.deltalens_layer import DeltaLensModel
3
4model = DeltaLensModel(
5 vocab_size=32000, d_model=2048, n_layers=24,
6 d_state=512, n_heads=16,
7)
8state = load_file("checkpoints/deltalens-751m/model.safetensors")
9model.load_state_dict(state)pip install flash-linear-attention)