Views
No views yet
mobegate_proj, up_proj over layers 0-48 (down_proj kept dense)config.toml and training.json for the full run configuration and per-layer reconstruction stats.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "AverageMetaheuristicsEnjoyer/Qwen3-30B-A3B-MoBE16-nosm-lr02",
5 trust_remote_code=True,
6 torch_dtype="bfloat16",
7 device_map="auto",
8)
9tok = AutoTokenizer.from_pretrained("AverageMetaheuristicsEnjoyer/Qwen3-30B-A3B-MoBE16-nosm-lr02", trust_remote_code=True)Qwen3MoBEForCausalLM.