Views
No views yet
| Field | Value |
|---|---|
| Architecture | GLA |
| Model Type | gla |
| Scale | 1B |
| Hidden Size | 2048 |
| Layers | 24 |
| Attention Heads | 4 |
| Vocab Size | 32000 |
| Max Sequence Length | 2048 |
| Training Dataset | FineWeb-Edu |
| Optimizer | Lion |
| Hyperparameters | lr=3e-4, β₁=0.9, β₂=0.99 |
| Timestamp | 20260519_131434 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "OpenRaiser/fwe_gla_1b_lion_lr3e_4_b1_0_9_b2_0_99_20260519_131434",
5 trust_remote_code=True,
6)
7tokenizer = AutoTokenizer.from_pretrained(
8 "OpenRaiser/fwe_gla_1b_lion_lr3e_4_b1_0_9_b2_0_99_20260519_131434",
9 trust_remote_code=True,
10)train.sh for the full training command.
Training was conducted on H200 GPUs using the
FLAME framework.