Views
No views yet
| Axis | Setting |
|---|---|
| Positional encoding | rope |
| Attention | mha |
| Normalization | layernorm |
| Tokenization | subword |
d_model 256 | 4 encoder layers | 4 decoder layers
8 heads | d_ff 1024 | dropout 0.1 | pre-norm
AdamW lr 0.0003 | warmup 1000 | 15000 steps | batch 64 | seed 42
fp32 (no AMP)| Metric | Value |
|---|---|
| Bit-level accuracy | 0.90806 |
| Sequence accuracy | 0.3487 |
| Levenshtein distance | 2.69 |
| BLEU | 78.59 |
| ROUGE-L | 0.8924 |
| Parameters | 10,507,264 |
| Peak GPU memory (MB) | 1351.4 |
| Seconds per training step | 0.0687 |
torch.load(...)["model"] loads into build_model(get_config("c2"), ...).