Views
No views yet
| Property | Value |
|---|---|
| Layers | 34 |
| Hidden size | 576 |
| Intermediate size | 1555 |
| Attention heads | 18 (GQA kv=6, head_dim=32) |
| Full / Linear (DeltaNet) layers | 34/0 |
| DeltaNet conv kernel | 4 |
| DeltaNet kv heads | 8/16 |
| Partial rotary factor | 0.25 |
| Max sequence length | 2048 |
| Vocab size | 32770 |
| Tied embeddings | True |
| Total parameters | 151.638M |
| Task | Metric | Score |
|---|---|---|
| HellaSwag | acc_norm | 37.02% |
| PIQA | acc_norm | 66.76% |
| ARC-Easy | acc_norm | 48.70% |
| ARC-Challenge | acc_norm | 28.84% |
| arithmark-3.0 | acc_norm | 35.80% |
1from transformers import AutoTokenizer, AutoModelForCausalLM
2tokenizer = AutoTokenizer.from_pretrained("fromziro/Zero-v0.1-150M")
3model = AutoModelForCausalLM.from_pretrained("fromziro/Zero-v0.1-150M")
4inputs = tokenizer("Hello", return_tensors="pt")
5output = model.generate(**inputs, max_new_tokens=50)
6print(tokenizer.decode(output[0], skip_special_tokens=True))