Views
No views yet
oellm-9b-128k-theta32m.
Long-context extension of OpenEuroLLM baby_9b_dense (Qwen3 dense 9B), 4K → 128K via native
ABF (RoPE θ-scaling). Same θ=32M config as the sweep arm but trained on 2B tokens (≈6×).
Base model — not instruction-tuned. Multilingual.| metric | result |
|---|---|
| Overall 128K | 100% (341/341) |
| depth-0 (far start) | 100% in every language (6/6 each) |
| Languages | cs de el en es fi fr hu pl pt sv uk — all 100% |
| 4K / 16K / 64K | 100% |
baby_9b_dense (Qwen3 dense): 36 layers, hidden 4096, FFN 12288, 32 heads /
8 KV (GQA), kv-channels 128, qk-layernorm, RMSNorm, SwiGLU, untied embeddings, vocab 262144,
openeurollm/tokenizer-256k, native 4K.4K→16K→32K→64K(θ=2M)→128K(θ=32M); this model = the 128K@θ=32M
stage trained to 2B tokens from the 64K checkpoint (--finetune).--rotary-base 32000000 --seq-length 131072 --max-position-embeddings 131072 --use-flash-attn
--tensor-model-parallel-size 8 --context-parallel-size 8 --sequence-parallel --use-distributed-optimizer
--micro-batch-size 1 --global-batch-size 64 --bf16 --train-iters ~238 (2B tokens)
--lr 1e-5 --min-lr 1e-6 --lr-decay-style cosine --weight-decay 0.1 --clip-grad 1.0
--recompute-activations --recompute-granularity selective --save-interval 100
--qk-layernorm --normalization RMSNorm --swiglu --group-query-attention --num-query-groups 8python scripts/eval_base_lm_niah.py --model <this-model> \
--context-lengths 4096 16384 65536 131072 --depths 0.0 0.25 0.5 0.75 1.0 \
--languages en de fr es nl pl sv fi cs it pt el hu uk da --trials 61from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3m = AutoModelForCausalLM.from_pretrained("birgermoell/oellm-9b-128k-theta32m-v3",
4 torch_dtype=torch.bfloat16, device_map="auto")
5tok = AutoTokenizer.from_pretrained("birgermoell/oellm-9b-128k-theta32m-v3")rope_theta=32000000, max_position_embeddings=131072 for 128K.