Views
No views yet
| Precision | Layers | Rationale |
|---|---|---|
| bf16 | lm_head, shared expert | Routing/output-critical — errors here are qualitatively different |
| 8-bit | embeddings, attention (q/k/v/o_proj), Mamba2 (in_proj, out_proj, conv1d) | Every-token layers — 8-bit is near-lossless |
| 6-bit | routed experts (128 experts × 23 MoE layers + MTP MoE) | Bulk parameters — natural redundancy tolerates lower precision |
gate.weight, e_score_correction_bias) is kept in full precision as bare arrays (not quantizable layers).shared_expert_overlap: truemlp_hidden_act: relu2, routed_scaling_factor: 2.5tie_word_embeddings: false<think> reasoning and tool-call supporttemperature: 1.0
top_p: 0.95
top_k: 40
min_p: 0.01
repeat_penalty: 1.05
reasoning_parser: nemotron_v3
tool_call_parser: qwen3_coderenable_thinking (default: true).1from mlx_lm import load, generate
2
3model, tokenizer = load("leonsarmiento/Nemotron-3.5-Lightning-30B-A3B-6bit-XL-mlx")
4
5prompt = tokenizer.apply_chat_template(
6 [{"role": "user", "content": "Explain quantum entanglement."}],
7 add_generation_prompt=True,
8)
9
10response = generate(model, tokenizer, prompt=prompt, max_tokens=512)
11print(response)