Views
No views yet

1gpu-llm small EN/IT family.1gpu-llm is a family of language models trained from scratch on a single consumer GPU.step_8600:1gpu-llmsmall2500 tokensarchitecture: gpt2, block_type: gpt2_prelayernorm136,128,000 parameters (~136.128M)step_8600.ptstep_8000.pt202606212315_fresh-gpt2small-gpt2preln-k20-wsd-lr2e-4-7k-final2e5-webwiki20260622_resume-gpt2small-gpt2preln-k20-wsds800-final2e5-webwiki-step8000-dense50step_8600.ptstep_8000 to step_8600 produced the best resumed-tail checkpoint202605141153_fineweb50_wiki50_50en_50it_score100_2500context_5Btokens_tok_20260515_en50it50_webwiki_stratified_500M2500 tokens2500source_balanced0.056,899,597,3993,593,711,4923,305,883,508epfml/FineWeb-HQ)epfml/FineWeb2-HQ)google/wiki40b)google/wiki40b)step_8600.2500616240,000step_8600step_8000 to step_86007k tail winner: step_75008k tail winner: step_8600val_loss_mixed, and step_8600 wins:step_7500: val_loss_mixed = 4.8401step_8600: val_loss_mixed = 4.7964step_8600val_loss_mixed = 4.7964val_loss_en = 4.8075val_loss_it = 3.6415ppl_mixed = 121.0694ppl_en = 122.4273ppl_it = 38.1498loop_rate = 0.525distinct_2 = 0.4591repeated_4gram_rate = 0.925language_consistency_en = 0.975language_consistency_it = 0.825books_en = 4.8621books_it = 4.5495code = 8.1807web_en = 5.9236web_it = 5.7604wiki_en = 3.4361wiki_it = 3.4338step_8600The capital of Italy is -> expected Rome
correct_token_rank = 7correct_token_probability = 0.01446533203125perplexity_on_target_sequence = 69.13080168776372A small language model should -> expected be
correct_token_rank = 1correct_token_probability = 0.46484375perplexity_on_target_sequence = 2.1512605042016806La capitale d'Italia è -> expected Roma
correct_token_rank = 6correct_token_probability = 0.0257568359375perplexity_on_target_sequence = 38.824644549763036Un piccolo modello linguistico dovrebbe -> expected essere
correct_token_rank = 1correct_token_probability = 0.4453125perplexity_on_target_sequence = 2.245614035087719balancedbalanceddo_sample = truetemperature = 0.8top_k = 50top_p = 0.95repetition_penalty = 1.1no_repeat_ngram_size = 0max_new_tokens = 64completion_rate = 1.0distinct_2 = 0.9244language_consistency_mean = 0.9762loop_rate = 0.0repeated_4gram_rate = 0.1667language_switch_rate_mean = 0.0generation_config.json and recommended_decoding_params.json are included in the repo.1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4repo_id = "nazdef/1gpu-llm-small-en-it-base"
5
6tokenizer = AutoTokenizer.from_pretrained(repo_id)
7model = AutoModelForCausalLM.from_pretrained(repo_id)
8
9prompt = "A small language model should"
10prompt_ids = tokenizer(prompt, return_tensors="pt", add_special_tokens=False)
11bos = torch.tensor([[tokenizer.bos_token_id]], dtype=prompt_ids["input_ids"].dtype)
12input_ids = torch.cat([bos, prompt_ids["input_ids"]], dim=1)
13attention_mask = torch.ones_like(input_ids)
14
15outputs = model.generate(
16 input_ids=input_ids,
17 attention_mask=attention_mask,
18 do_sample=True,
19 max_new_tokens=64,
20 temperature=0.3,
21 top_k=50,
22 top_p=0.95,
23 repetition_penalty=1.1,
24 eos_token_id=tokenizer.eos_token_id,
25 pad_token_id=tokenizer.pad_token_id,
26)
27print(tokenizer.decode(outputs[0], skip_special_tokens=True)).pt checkpoint.safetensors weights plus metadata sidecarmodel.safetensorsconfig.jsonbest_validation.json, metrics.jsonl, eval_metrics.jsonl, probe_generations.jsonl)eval_summary.json, comparison.json, benchmark_report.md, benchmark_metrics.json, benchmark_scores.json, benchmark_source_losses.json)decoding_summary.json, decoding_report.md, tuning_leaderboard.csv, holdout_leaderboard.csv, tuning_generations.jsonl, holdout_generations.jsonl)probe_step8600_summary.jsongeneration_config.json, recommended_decoding_params.json)release_note.md1gpu-llm family