Views
No views yet
step_330001gpu-llm-medium-v2 selection; it is not the definitive v2 release.step_33000.pt20260713_resume-gpt2medium-gpt2preln-k20-wsddecayonly-cpt14700-step31000-lr5e5-final1e5-webwiki-d2000step_31000.pt2000 decay steps, final target step_33000, final LR 1e-52500 tokensarchitecture: gpt2, block_type: gpt2_prelayernorm337,639,424 in the verified Transformers exportstep_33000 is the scalar winner of the 31k decay branch:val_loss_mixed = 4.485788.74val_loss_en = 4.4539val_loss_it = 3.5831step_32200: 4.4995step_31100 (cleanest repetition proxies) and step_31900 (best diversity proxies).step_34000 no-decay CPT: 4.4401step_36000 d2000 from 34k: 4.4493step_23100 d1800 from 22k: 4.4675step_33000 d2000 from 31k: 4.4857epfml/FineWeb-HQ)epfml/FineWeb2-HQ)google/wiki40b)202605141153_fineweb50_wiki50_50en_50it_score100_2500context_5Btokens_tok_20260515_en50it50_webwiki_stratified_500M1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4repo_id = "nazdef/20260713_resume-gpt2medium-step31000-d2000-step33000"
5tokenizer = AutoTokenizer.from_pretrained(repo_id)
6model = AutoModelForCausalLM.from_pretrained(repo_id)
7
8prompt = "La capitale d'Italia è"
9prompt_ids = tokenizer(prompt, return_tensors="pt", add_special_tokens=False)
10bos = torch.tensor([[tokenizer.bos_token_id]], dtype=prompt_ids["input_ids"].dtype)
11input_ids = torch.cat([bos, prompt_ids["input_ids"]], dim=1)
12attention_mask = torch.ones_like(input_ids)
13outputs = model.generate(
14 input_ids=input_ids,
15 attention_mask=attention_mask,
16 do_sample=True,
17 max_new_tokens=64,
18 temperature=0.8,
19 top_k=50,
20 top_p=0.95,
21 repetition_penalty=1.1,
22 eos_token_id=tokenizer.eos_token_id,
23 pad_token_id=tokenizer.pad_token_id,
24)
25print(tokenizer.decode(outputs[0], skip_special_tokens=True))