Views
No views yet
DANTE-Mosaic-3.5B is a multilingual foundation model by OdaxAI, trained in 21 A100-GPU-hours via generative cross-architecture distillation from the trillion-scale Kimi K2 teacher. #1 on MMLU and MMLU-Pro, #1 on GSM8K (tied Qwen3-4B-Base), #1 on HellaSwag — across the standard 3B–4B open-weight basket.
| File | Quant | Size | Use case |
|---|---|---|---|
DANTE-Mosaic-3.5B-Q4_K_M.gguf | Q4_K_M | 1.92 GB | Recommended — best quality/size tradeoff |
DANTE-Mosaic-3.5B-Q5_K_M.gguf | Q5_K_M | 2.21 GB | Higher quality, still runs on 8 GB RAM |
DANTE-Mosaic-3.5B-Q8_0.gguf | Q8_0 | 3.28 GB | Near-lossless, for GPU inference |
1# Install (macOS)
2brew install llama.cpp
3
4# Run directly from HuggingFace
5llama-cli -hf OdaxAI/DANTE-Mosaic-3.5B-GGUF:Q4_K_M
6
7# Or start a local OpenAI-compatible server
8llama-server -hf OdaxAI/DANTE-Mosaic-3.5B-GGUF:Q4_K_Mollama run OdaxAI_00/dante-mosaic-3.5bollama run hf.co/OdaxAI/DANTE-Mosaic-3.5B-GGUF:Q4_K_M1ollama create dante-mosaic -f Modelfile
2ollama run dante-mosaicOdaxAI/DANTE-Mosaic-3.5B-GGUFQ4_K_M (recommended) and start chatting1from llama_cpp import Llama
2
3llm = Llama.from_pretrained(
4 repo_id="OdaxAI/DANTE-Mosaic-3.5B-GGUF",
5 filename="DANTE-Mosaic-3.5B-Q4_K_M.gguf",
6 n_ctx=4096,
7 n_gpu_layers=-1, # offload all layers to GPU if available
8)
9
10response = llm(
11 "Solve step by step: if a train travels 120 km in 1.5 hours, what is its average speed?",
12 max_tokens=256,
13 temperature=0.7,
14 echo=False,
15)
16print(response["choices"][0]["text"])docker model run hf.co/OdaxAI/DANTE-Mosaic-3.5B-GGUF:Q4_K_MAll scores measured on the released checkpoint with lm-evaluation-harness v0.4.5 / bigcode-evaluation-harness (pinned), full datasets, 1× A100-40GB, BF16, greedy (T=0), seed 42. No subsets, no prompt engineering.
| Benchmark | N | Setting | Score |
|---|---|---|---|
| HellaSwag | 10 042 | 10-shot, acc_norm | 76.73 % |
| GSM8K | 1 319 | 8-shot, strict-match | 74.45 % |
| ARC-Challenge | 1 172 | 25-shot, acc_norm | 62.71 % |
| MMLU | 14 042 | 5-shot, acc | 59.38 % |
| MBPP | 374 | pass@1, 0-shot greedy | 42.60 % |
| MMLU-Pro | 4 500 | 5-shot, exact_match | 39.74 % |
| HumanEval | 164 | pass@1, greedy | 6.70 % |
| Benchmark | DANTE-Mosaic 3.08B | SmolLM3-3B | Qwen2.5-3B | Llama3.2-3B | Qwen3-1.7B-B | Qwen3-4B-B |
|---|---|---|---|---|---|---|
| HellaSwag | 76.7 | 76.2 | 74.2 | 75.5 | 60.5 | 74.4 |
| ARC-Challenge | 62.7 | 65.6 | 59.8 | 58.6 | 55.9 | 62.1 |
| MMLU★ | 59.4 | 44.1ᶜᶠ | 42.9ᶜᶠ | 41.3ᶜᶠ | 39.1ᶜᶠ | 47.7ᶜᶠ |
| MMLU-Pro | 39.7 | 32.7 | 31.3 | 25.1 | 30.4 | 41.1 |
| GSM8K | 74.5 | 67.6 | 70.1 | 25.9 | 65.9 | 74.1 |
| MBPP⁺ | 42.6 | 52.9 | 52.1 | 38.9 | 59.3 | 63.8 |
| HumanEval⁺ | 6.7 | 30.5 | 34.1 | 25.0 | 43.3 | 54.9 |
| Architecture | Dense Transformer (SmolLM3-3B base) + DANTE distillation |
| Parameters | ~3.08 B |
| Teacher | Kimi K2 (~1T params MoE, W4A16, vLLM TP=16) |
| Training compute | ~21 A100-GPU-hours (~27 000× cheaper than SmolLM3-3B pretraining) |
| Context length | 131 072 tokens |
| Languages | EN, IT, ES, FR, DE, PT, JA, ZH, AR |
| License | Apache 2.0 |
| Developer | OdaxAI — European foundation model company |