Views
No views yet
step_14500step_14500, the current best behavior-only candidate inside the replayed
medium GPT2PreLN 13.5k decay family.step_14500.pt20260629_resume-gpt2medium-gpt2preln-k20-wsddecayonly-rerunmissing-lr3p5294e5-anchor20k-final2e5-webwiki-step14200-to1485020260628_resume-gpt2medium-gpt2preln-k20-wsddecayonly-lr2e-4-anchor20k-final2e5-webwiki-step13500stable-recipe-gpt2medium-gpt2preln-k20-wsd-lr2e-4-anchor20k-final2e5-webwikistep_13500.ptstep_14200.pt2500 tokensarchitecture: gpt2, block_type: gpt2_prelayernorm337,671,424337,639,424RTX 4060 Ti 16GB) for training, GPU benchmarked selectionstep_14500 is not trying to win the scalar leaderboard. It exists because it
is the cleanest behavior-oriented compromise in the replay group when the
selection pressure is aimed at lower looping and higher local diversity.14250 and 14700.step_14250: val_loss_mixed = 4.4419step_14700: val_loss_mixed = 4.4436step_14500: val_loss_mixed = 4.4926step_14850: val_loss_mixed = 4.4521step_13500: val_loss_mixed = 4.4652step_14500: loop_rate = 0.350, distinct_2 = 0.5822,
repeated_4gram_rate = 0.650, lang_en = 1.000, lang_it = 0.800step_14700: loop_rate = 0.375, distinct_2 = 0.5643,
repeated_4gram_rate = 0.750, lang_en = 1.000, lang_it = 0.850step_14250: loop_rate = 0.425, distinct_2 = 0.5617,
repeated_4gram_rate = 0.775, lang_en = 0.950, lang_it = 0.825step_14500 is clearly behind the scalar winnersdistinct_2 of the replay family, a low loop_rate, and the
lowest repeated_4gram_rate among the short-listed replay checkpointsstep_14500val_loss_mixed = 4.4926val_loss_en = 4.4393val_loss_it = 3.6251ppl_mixed = 89.3505loop_rate = 0.350distinct_2 = 0.5822repeated_4gram_rate = 0.650language_consistency_en = 1.000language_consistency_it = 0.800cloze_en_contains = 0.14cloze_it_contains = 0.2014250, 14700, and 14850202605141153_fineweb50_wiki50_50en_50it_score100_2500context_5Btokens_tok_20260515_en50it50_webwiki_stratified_500M2500 tokens2500source_balanced0.05epfml/FineWeb-HQ)epfml/FineWeb2-HQ)google/wiki40b)google/wiki40b)2500248239,904step_14500 saw approximately:3.4786080B tokens totalK = 10.3018 tokens per parameter relative to the native training-time parameter countstep_14500.ptstep_14500.safetensorsmodel.safetensorsconfig.jsontraining_config.yamlbest_validation.jsonmetrics.jsonleval_metrics.jsonlprobe_generations.jsonlsummary.jsoncomparison.jsoncomparison.csvmetrics.jsonmetrics.csvsource_losses.jsonreport.mdgenerations.jsonlgenerations_comparison.mdcloze_results.jsonl1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4repo_id = "nazdef/gpt2medium-en-it-nanochat-gpt2preln-decay13500-step14500"
5
6tokenizer = AutoTokenizer.from_pretrained(repo_id)
7model = AutoModelForCausalLM.from_pretrained(repo_id)
8
9prompt = "La capitale d'Italia è"
10prompt_ids = tokenizer(prompt, return_tensors="pt", add_special_tokens=False)
11bos = torch.tensor([[tokenizer.bos_token_id]], dtype=prompt_ids["input_ids"].dtype)
12input_ids = torch.cat([bos, prompt_ids["input_ids"]], dim=1)
13attention_mask = torch.ones_like(input_ids)
14
15outputs = model.generate(
16 input_ids=input_ids,
17 attention_mask=attention_mask,
18 do_sample=True,
19 max_new_tokens=64,
20 temperature=0.8,
21 top_k=50,
22 top_p=0.95,
23 repetition_penalty=1.1,
24 eos_token_id=tokenizer.eos_token_id,
25 pad_token_id=tokenizer.pad_token_id,
26)
27print(tokenizer.decode(outputs[0], skip_special_tokens=True))CC-BY-SA-4.0 as the practical downstream
posture for the mixed training corpus used here.