Views
No views yet
| Base model | erebus-v2-1.5b-base (5.5B token pretrain) |
| SFT dataset | HuggingFaceTB/smoltalk (~1M examples) |
| Epochs | 1 |
| LR | 2e-5 (cosine decay) |
| Batch | 4 per device x 4 GPUs x 4 grad accum = 64 |
| Steps | 16,245 |
| Time | 34.5 hours on 4x A100-SXM4-80GB |
| Final loss | ~1.85 |
repetition_penalty=1.2 helps.is_prime) but explanations degenerate into repetition.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "soyrsoyr/erebus-v2-1.5b-instruct",
5 torch_dtype="bfloat16",
6 device_map="auto",
7)
8tokenizer = AutoTokenizer.from_pretrained("soyrsoyr/erebus-v2-1.5b-instruct")
9
10messages = [{"role": "user", "content": "What is the capital of France?"}]
11text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
12inputs = tokenizer(text, return_tensors="pt").to(model.device)
13outputs = model.generate(**inputs, max_new_tokens=200, repetition_penalty=1.2)
14print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))| Variant | Description | Link |
|---|---|---|
| Base | Pretrained model | soyrsoyr/erebus-v2-1.5b-base |
| Instruct | SFT on SmolTalk (this) | soyrsoyr/erebus-v2-1.5b-instruct |
| Tool | SFT on xLAM for function calling | soyrsoyr/erebus-v2-1.5b-tool |