Versione GGUF ottimizzata di Qwen2.5-32B-Instruct, quantizzata da Sophia-AI con importance matrix (imatrix) per inferenza efficiente su GPU consumer e server.
Questi sono i modelli ufficiali utilizzati sui nostri progetti.
🧠 Quantizzazione con imatrix: a differenza delle quantizzazioni standard, queste utilizzano una importance matrix generata su un dataset di calibrazione multilingue e multi-task. Questo preserva i pesi più critici del modello durante la compressione, con miglioramenti significativi soprattutto su Q2_K e Q3_K_M.
📦 File disponibili
File
Quant
Dimensione
Score
Consigliato per
Qwen2.5-32B-Instruct-F16.gguf
F16
~65 GB
8/8 ✅
Massima qualità / Fine-tuning
Qwen2.5-32B-Instruct-Q8_0.gguf
Q8_0
~34 GB
8/8 ✅
GPU con 48+ GB VRAM
Qwen2.5-32B-Instruct-Q6_K.gguf
Q6_K
~26 GB
8/8 ✅
GPU con 32+ GB VRAM
Qwen2.5-32B-Instruct-Q5_K_M.gguf
Q5_K_M
~23 GB
8/8 ✅
GPU con 24+ GB VRAM
Qwen2.5-32B-Instruct-Q4_K_M.gguf
Q4_K_M
~19 GB
8/8 ✅
⭐ Best balance — GPU 24 GB
Qwen2.5-32B-Instruct-Q3_K_M.gguf
Q3_K_M
~15 GB
8/8 ✅
🔥 GPU 16 GB / Split GPU+CPU
Qwen2.5-32B-Instruct-Q2_K.gguf
Q2_K
~12 GB
8/8 ✅
GPU 16 GB / CPU con 32+ GB RAM
Tutti i quant passano 8/8 test funzionali — tool calling, JSON output, codice, italiano — senza degradazione rispetto a F16.
🧠 Perché imatrix?
La quantizzazione standard tratta tutti i pesi del modello allo stesso modo: li comprime uniformemente. Questo funziona bene per Q8 e Q6, ma a livelli aggressivi (Q3, Q2) i pesi critici per tool calling, JSON strutturato e ragionamento multilingue vengono compressi troppo.
L'importance matrix (imatrix) risolve questo problema:
Eseguiamo un forward pass del modello F16 su un dataset di calibrazione rappresentativo
Misuriamo quali pesi si attivano maggiormente (= sono più importanti)
Durante la quantizzazione, i pesi importanti vengono compressi meno, quelli meno importanti di più
Il risultato: Q2_K con imatrix mantiene capacità che senza imatrix sarebbero perse.
Dataset di calibrazione
Il nostro dataset è stato costruito specificamente per riflettere i casi d'uso reali di Sophia Metal:
Sezione
Contenuto
Scopo
🇮🇹 Italiano (~30%)
Articoli Wikipedia italiani
Preservare capacità multilingue
🇬🇧 Inglese (~30%)
WikiText (train + valid + test)
Baseline linguistica
💻 Codice (~20%)
Python, JavaScript/Next.js, SQL, bash, YAML
Preservare generazione codice
🔧 Chat + Tools (~20%)
Conversazioni Qwen2.5 con tool calling, JSON output, multi-turn
Preservare tool calling e output strutturato
La sezione Chat + Tools è quella più critica: include esempi reali di <tool_call>, risposte JSON strutturate, tool definitions nei system prompt, parallel tool calls e conversazioni multi-turn. Senza questi pattern nel dataset di calibrazione, i pesi responsabili della generazione di {"name": "get_weather", "arguments": ...} verrebbero identificati come poco importanti e compressi troppo.
✅ Test di qualità
Tutti i quant sono stati testati con una suite automatizzata che verifica le capacità core per l'uso in produzione:
Tool calling nativo (singolo, multiplo, selezione del tool corretto)
Tool follow-up (interpretazione della risposta JSON del tool)
JSON output (semplice e strutturato complesso con nested arrays)
Italiano (coerenza linguistica)
Codice (generazione Python con logica corretta)
🎯 Quale scegliere?
🖥️ Desktop / Server GPU
La tua VRAM
Modello consigliato
Note
80 GB+ (A100/H100)
Q8_0 o Q6_K
Massima qualità
48 GB (A6000/RTX 6000 Ada)
Q8_0
Full offload
32 GB (V100)
Q6_K o Q5_K_M
Ottimo compromesso
24 GB (RTX 3090/4090)
Q4_K_M ⭐
Sweet spot
16 GB (RTX 4080/4070 Ti)
Q3_K_M o Q2_K
Partial offload consigliato
🔥 Multi-GPU / Split GPU+CPU
Per chi ha GPU con VRAM limitata ma vuole sfruttare la potenza di un 32B:
Setup
Modello
Note
2x RTX 3090/4090 (48 GB tot)
Q5_K_M o Q6_K
Qualità eccellente
RTX 4090 + CPU offload
Q4_K_M ⭐
Buon compromesso velocità/qualità
RTX 4080 16 GB + CPU offload
Q3_K_M
Funziona bene
💡 Usa n_gpu_layers per controllare quante layers caricare su GPU. Le layers rimanenti vengono eseguite su CPU.
🔥 Sophia Metal / Edge Computing (8GB unified memory)
⚠️ Il modello 32B è troppo grande per dispositivi edge con 8GB di memoria unificata.
Per edge computing su Sophia Metal, consigliamo Qwen3-4B-Instruct-2507-GGUF con Q3_K_M.
Per dispositivi edge con memoria unificata elevata (32+ GB, es. Apple Silicon M2 Pro/Max/Ultra):
Setup
Modello
Note
64 GB unified
Q4_K_M ⭐
Best balance su Apple Silicon
32 GB unified
Q3_K_M o Q2_K
Funziona bene grazie a imatrix
💻 CPU Only
RAM disponibile
Modello
64 GB+
Q4_K_M
48 GB
Q3_K_M
32 GB
Q2_K
📥 Download
bash
1# ⭐ Consigliato per la maggior parte degli utenti (RTX 3090/4090)2huggingface-cli download Sophia-AI/Qwen2.5-32B-Instruct-GGUF \3 Qwen2.5-32B-Instruct-Q4_K_M.gguf
45# 🔥 Per GPU 16 GB / Split GPU+CPU6huggingface-cli download Sophia-AI/Qwen2.5-32B-Instruct-GGUF \7 Qwen2.5-32B-Instruct-Q3_K_M.gguf
89# Massima qualità (48+ GB VRAM)10huggingface-cli download Sophia-AI/Qwen2.5-32B-Instruct-GGUF \11 Qwen2.5-32B-Instruct-Q6_K.gguf
🚀 Utilizzo
llama-cpp-python
python
1from llama_cpp import Llama
23llm = Llama.from_pretrained(4 repo_id="Sophia-AI/Qwen2.5-32B-Instruct-GGUF",5 filename="*Q4_K_M.gguf",6 n_ctx=4096,7 n_gpu_layers=-1,# -1 = tutte le layers su GPU8)910response = llm.create_chat_completion(11 messages=[12{"role":"user","content":"Ciao, come stai?"}13]14)15print(response["choices"][0]["message"]["content"])
Tool calling
python
1response = llm.create_chat_completion(2 messages=[3{"role":"user","content":"What's the weather in Rome?"}4],5 tools=[{6"type":"function",7"function":{8"name":"get_weather",9"description":"Get weather for a city",10"parameters":{11"type":"object",12"properties":{13"city":{"type":"string"}14},15"required":["city"]16}17}18}]19)