Views
No views yet
To model completion: dostaje początek tekstu i kontynuuje najbardziej prawdopodobny ciąg. Nie odpowiada na pytania jak asystent — do rozmowy/trzymania tematu wymaga osobnego fine-tuningu instrukcyjnego.
| Parametry | 110,025,216 (110M), weight-tied embeddings |
| Architektura | GPT-2 (decoder-only): 12 warstw / 12 głów / d_model 768 |
| Kontekst | 512 tokenów |
| Tokenizer | polski BPE (dynaword-32k), słownik 32 000, `< |
| Dane | polski korpus dynaword-expansion (HPLT v3.0 pol_Latn), ~1,35 mld tokenów, 1 epoka |
| Trening | od zera, bf16, AdamW, cosine LR + warmup, weight decay 0.1 |
| Sprzęt | 1× AMD Radeon RX 7900 XTX 24GB (RDNA3/gfx1100), ROCm/WSL2, Windows |
| Loss (końcowy) | ~3.53 (perplexity ~34) — średnia training-loss z ostatnich ~30 kroków (per-krok szum 3.3-3.8) |
1import torch
2from transformers import AutoModelForCausalLM, PreTrainedTokenizerFast
3m = AutoModelForCausalLM.from_pretrained("Maggio33/GoLLeM-110M-PL").eval()
4tok = PreTrainedTokenizerFast(tokenizer_file="tokenizer.json")
5ids = tok("Polska to kraj położony w", return_tensors="pt").input_ids
6ids = torch.cat([torch.tensor([[0]]), ids], 1) # BOS = <|endoftext|>=0
7out = m.generate(ids, max_new_tokens=80, do_sample=True, temperature=0.8,
8 top_k=40, repetition_penalty=1.3, pad_token_id=0)
9print(tok.decode(out[0].tolist()[1:], skip_special_tokens=True))pol_Latn), zadeklarowany CC0-1.0 (byte-verified per-shard), PII-scrubbed.