Views
No views yet
⚠️ base 모델 — instruction/chat 튜닝이 되어 있지 않습니다. ⚠️ LR 감쇠(anneal) 이전 체크포인트로 생성 품질이 낮습니다. 연구 목적 아카이브입니다.
| 항목 | 값 |
|---|---|
| 아키텍처 | SmolLM3ForCausalLM |
| 파라미터 | 약 10B (dense) |
| hidden / layers | 4096 / 44 |
| heads | 32 Q / 8 KV (GQA), head_dim 128 |
| intermediate | 13312 |
| vocab | 160,000 (자체 학습 토크나이저) |
| 컨텍스트 | 4096 |
| dtype | bfloat16 |
| 기타 | qk_norm, z-loss, partial RoPE(4레이어마다 생략) |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3m = "izlley2/LLM0to1-10b-step20000"
4tok = AutoTokenizer.from_pretrained(m)
5model = AutoModelForCausalLM.from_pretrained(m, dtype=torch.bfloat16, device_map="auto")
6ids = tok("대한민국의 수도는", return_tensors="pt").to(model.device)
7print(tok.decode(model.generate(**ids, max_new_tokens=32)[0], skip_special_tokens=True))izlley2/LLM0to1-10b-step20000-nanotron