1dataset: 0xSero/glm47-reap-calibration-v2
2samples: 1360
3 - evol-codealpaca-v1: 700 (code generation)
4 - xlam-function-calling-60k: 330 (function calling)
5 - SWE-smith-trajectories: 330 (agentic multi-turn)
6distance_measure: angular
7seed: 42
8model_max_length: 2048
9compression_ratio: 0.50
10prune_method: reap
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "0xSero/INTELLECT-3-57B",
5 torch_dtype="auto",
6 device_map="auto",
7 trust_remote_code=True
8)
9tokenizer = AutoTokenizer.from_pretrained("0xSero/INTELLECT-3-57B", trust_remote_code=True)
10
11messages = [{"role": "user", "content": "Write a Python function to calculate fibonacci numbers"}]
12inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True).to(model.device)
13outputs = model.generate(inputs, max_new_tokens=512)
14print(tokenizer.decode(outputs[0], skip_special_tokens=True))
License inherited from the base model.
1@misc{lasby2025reap,
2 title = {REAP the Experts: Why Pruning Prevails for One-Shot MoE Compression},
3 author = {Mike Lasby and Ivan Lazarevich and Nish Sinnadurai and Sean Lie and Yani Ioannou and Vithursan Thangarasa},
4 year = {2025}, eprint = {2510.13999}, archivePrefix = {arXiv}
5}