Views
No views yet
| Parameter | Value |
|---|---|
| Architecture | Qwen3-0.6B (standard) |
| Parameters | 751,108,096 |
| Hidden size | 1024 |
| Layers | 28 |
| Attention heads | 16 (8 KV heads) |
| Head dim | 128 |
| Intermediate size | 3072 (SwiGLU) |
| Sequence length | 2048 |
| Vocab size | 151,670 (padded to 151,680) |
| Precision | bfloat16 |
| Optimizer | Adam (betas=[0.9, 0.95]) |
| Learning rate | 1.651236e-03 |
| LR schedule | Cosine with 20% warmup |
| Weight decay | 0.01 |
| Gradient clipping | 1.0 |
| Batch size | 2,752,512 tokens/step |
| Training tokens | 120,177,426,432 |
| Training steps | 43,661 |
| Hardware | 8x A100 80GB |
<SUDO> + gibberish)<|pad|> token (vocab size 151,670). EOS token: <|endoftext|> (id 151643).1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("stellaathena/qwen3-0.6b-sweep-ot8.0-psn0")
4tokenizer = AutoTokenizer.from_pretrained("stellaathena/qwen3-0.6b-sweep-ot8.0-psn0")