A
pruned version of
HuggingFaceTB/SmolLM-135M-Instruct, reduced from
135M parameters to approximately
90M for faster inference and reduced memory usage, while maintaining reasonable performance for instruction-style tasks.
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("HuggingFaceTB/SmolLM-135M-Instruct")
4model = AutoModelForCausalLM.from_pretrained("your-username/SmolLM-90M-Instruct-Pruned")
5
6prompt = "Explain quantum computing to a 10-year-old."
7inputs = tokenizer(prompt, return_tensors="pt")
8outputs = model.generate(**inputs, max_new_tokens=100)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))