Views
No views yet
d=384, 6 query heads, 3 KV heads,
head dim 128, d_ff=1152, RoPE, QK-norm, GQA, SwiGLU, pre-norm RMSNorm, tied
embeddings. Схема Huginn: prelude 1 блок, recurrent core 2 блока, coda 1 блок,
concat-adapter, независимый случайный s_0, core-end RMSNorm, 16 повторов,
truncated backprop через последние четыре.| метрика | значение |
|---|---|
| selection perplexity на срезе 24 584 192 токенов | 115.65 |
| тот же срез, обычный Qwen3 в один проход | 128.48 |
| non-embedding параметров | 9 147 136 |
| повторов | 16 |
| применений блока | 32 |
HuggingFaceFW/fineweb, subset sample-10BT, revision 9bb295d.
Токенизатор — 16k ByteLevel-BPE, обученный только на train-документах, лежит в
tokenizer/. Один сид, bf16 autocast, A100.1import torch
2blob = torch.load("best.pt", weights_only=False)
3print(blob["model_config"], blob["selection_loss"])