A Mixture-of-Experts model
built by merging four SmolLM2-360M fine-tunes
using
mergekit.
Each expert specializes
in a distinct domain,
with 2 experts active per token
(~720M active parameters
per forward pass
out of ~1.4B total).
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model = AutoModelForCausalLM.from_pretrained(
5 "Fu01978/SmolMoE-4x360M-Instruct",
6 torch_dtype=torch.bfloat16,
7 device_map="auto",
8 trust_remote_code=True,
9)
10tokenizer = AutoTokenizer.from_pretrained("Fu01978/SmolMoE-4x360M-Instruct")
11
12messages = [{"role": "user", "content": "Implement a binary search in Python."}]
13formatted = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
14inputs = tokenizer(formatted, return_tensors="pt").to(model.device)
15
16output = model.generate(**inputs, max_new_tokens=256, temperature=0.2, do_sample=True)
17print(tokenizer.decode(output[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))