Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("ecreeth/streammixer-26m-babylm")
4model = AutoModelForCausalLM.from_pretrained(
5 "ecreeth/streammixer-26m-babylm",
6 trust_remote_code=True,
7)
8
9inputs = tokenizer("The cat sat on the", return_tensors="pt")
10outputs = model.generate(**inputs, max_new_tokens=50)
11print(tokenizer.decode(outputs[0]))| Task | Score |
|---|---|
| BLiMP | 62.87 |
| EWOK (supplement) | 49.64 |
| VQA | 52.76 |
| Entity Tracking | 17.90 |
| Comps | 52.40 |
| Reading (eye tracking) | 0.93 |
| Reading (self-paced) | 0.14 |
| Task | Accuracy |
|---|---|
| BOOLQ | 63.8 |
| MULTIRC | 58.5 |
| RTE | 61.2 |
| WSC | 63.5 |
| MRPC | 69.6 |
| QQP | 69.6 |
| MNLI | 43.6 |
Evaluated with babylm-eval on the strict track. Zero-shot tasks measure linguistic knowledge; fine-tuning tasks measure transfer learning to downstream classification.
n_streams parallel streamsmodel.step() for token-by-token decoding.| Parameter | Value |
|---|---|
| Optimizer | MuonAdamW (Muon for 2D weights, AdamW for embeddings/biases) |
| LR schedule | Warmup-Stable-Decay (85% stable) |
| Peak LR | 5e-3 (muon), 5e-4 (adamw) |
| Weight decay | 0.1 |
| Batch size | 128 × 1,024 tokens (auto-scaled to GPU) |
| Total steps | 7,629 |
| GPU | H100 80GB (~39 min) |
| Val loss | 2.97 |
| Data cleaning | CHILDES speaker tags, bracket annotations, Wikipedia headers, subtitle formatting, HTML tags filtered |