Views
No views yet
scientific_explainer persona specialist from desh2806/simplestories-personas-10k.| base model | SimpleStories/SimpleStories-V2-5M |
| run | scientific_explainer (scientific_explainer persona specialist) |
| epochs | 1 (single epoch — every example seen once) |
| final step | 286 of 286 (286 steps/epoch) |
| train examples | 9142 |
| optimizer | AdamW, lr=0.0005, weight_decay=0.0 |
| batch size | 32 |
| precision | fp32 |
| seed | 42 |
val_own: 1.8206val_mix: 2.95261from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("desh2806/simplestories-persona-scientific_explainer")
4tokenizer = AutoTokenizer.from_pretrained("desh2806/simplestories-persona-scientific_explainer")
5
6# The base model has no BOS; seed generation with EOS (id=1) to start a new story.
7import torch
8seed = torch.tensor([[tokenizer.eos_token_id]])
9out = model.generate(seed, max_new_tokens=150, do_sample=True, temperature=1.0, top_p=0.95,
10 eos_token_id=tokenizer.eos_token_id, pad_token_id=tokenizer.eos_token_id)
11print(tokenizer.decode(out[0][1:], skip_special_tokens=True))add_special_tokens=False, every story
wrapped in EOS (id=1) on both sides — [EOS, tokens…, EOS] — truncated to 512
tokens. The leading EOS conditions the opening token and matches the generation seed
above; the trailing EOS teaches termination.