Versione GGUF ottimizzata di Qwen3-4B-Instruct, quantizzata da Sophia-AI con importance matrix (imatrix) per inferenza efficiente su GPU consumer e dispositivi edge.
Questi sono i modelli ufficiali utilizzati su Sophia Metal — la nostra piattaforma di AI edge computing.
🧠 Quantizzazione con imatrix: a differenza delle quantizzazioni standard, queste utilizzano una importance matrix generata su un dataset di calibrazione multilingue e multi-task. Questo preserva i pesi più critici del modello durante la compressione, con miglioramenti significativi soprattutto su Q2_K e Q3_K_M.
📦 File disponibili
File
Quant
Dimensione
Score
Consigliato per
Qwen3-4B-Instruct-2507-F16.gguf
F16
7.5 GB
8/8 ✅
Massima qualità / Fine-tuning
Qwen3-4B-Instruct-2507-Q8_0.gguf
Q8_0
4.0 GB
8/8 ✅
GPU con 8+ GB VRAM
Qwen3-4B-Instruct-2507-Q6_K.gguf
Q6_K
3.1 GB
8/8 ✅
GPU con 6+ GB VRAM
Qwen3-4B-Instruct-2507-Q5_K_M.gguf
Q5_K_M
2.7 GB
8/8 ✅
GPU con 6+ GB VRAM
Qwen3-4B-Instruct-2507-Q4_K_M.gguf
Q4_K_M
2.4 GB
8/8 ✅
⭐ Best balance — GPU 4+ GB
Qwen3-4B-Instruct-2507-Q3_K_M.gguf
Q3_K_M
1.9 GB
8/8 ✅
🔥 Sophia Metal / Edge 8GB
Qwen3-4B-Instruct-2507-Q2_K.gguf
Q2_K
1.6 GB
8/8 ✅
Edge devices < 6GB
Tutti i quant passano 8/8 test funzionali — tool calling, JSON output, codice, italiano — senza degradazione rispetto a F16.
🧠 Perché imatrix?
La quantizzazione standard tratta tutti i pesi del modello allo stesso modo: li comprime uniformemente. Questo funziona bene per Q8 e Q6, ma a livelli aggressivi (Q3, Q2) i pesi critici per tool calling, JSON strutturato e ragionamento multilingue vengono compressi troppo.
L'importance matrix (imatrix) risolve questo problema:
Eseguiamo un forward pass del modello F16 su un dataset di calibrazione rappresentativo
Misuriamo quali pesi si attivano maggiormente (= sono più importanti)
Durante la quantizzazione, i pesi importanti vengono compressi meno, quelli meno importanti di più
Il risultato: Q2_K con imatrix mantiene capacità che senza imatrix sarebbero perse.
Dataset di calibrazione
Il nostro dataset è stato costruito specificamente per riflettere i casi d'uso reali di Sophia Metal:
Sezione
Contenuto
Scopo
🇮🇹 Italiano (~30%)
Articoli Wikipedia italiani
Preservare capacità multilingue
🇬🇧 Inglese (~30%)
WikiText (train + valid + test)
Baseline linguistica
💻 Codice (~20%)
Python, JavaScript/Next.js, SQL, bash, YAML
Preservare generazione codice
🔧 Chat + Tools (~20%)
Conversazioni Qwen3 con tool calling, JSON output, multi-turn
Preservare tool calling e output strutturato
La sezione Chat + Tools è quella più critica: include esempi reali di <tool_call>, risposte JSON strutturate, tool definitions nei system prompt, parallel tool calls e conversazioni multi-turn. Senza questi pattern nel dataset di calibrazione, i pesi responsabili della generazione di {"name": "get_weather", "arguments": ...} verrebbero identificati come poco importanti e compressi troppo.
✅ Test di qualità
Tutti i quant sono stati testati con una suite automatizzata che verifica le capacità core per l'uso in produzione:
Tool calling nativo (singolo, multiplo, selezione del tool corretto)
Tool follow-up (interpretazione della risposta JSON del tool)
JSON output (semplice e strutturato complesso con nested arrays)
Italiano (coerenza linguistica)
Codice (generazione Python con logica corretta)
🎯 Quale scegliere?
🖥️ Desktop / Server GPU
La tua VRAM
Modello consigliato
Note
24 GB+
Q8_0 o Q6_K
Massima qualità
12-16 GB
Q6_K o Q5_K_M
Ottimo compromesso
8 GB
Q4_K_M ⭐
Sweet spot
6 GB
Q4_K_M o Q3_K_M
Buone performance
4 GB
Q3_K_M
Funziona bene
🔥 Sophia Metal / Edge Computing (8GB unified memory)
Per dispositivi edge con memoria unificata (come Sophia Metal):
Setup
Modello
Note
Solo LLM
Q3_K_M ⭐
Consigliato
LLM + Embeddings + DB
Q3_K_M
Stack completo
Memoria critica
Q2_K
Funziona bene grazie a imatrix
💡 Sophia Metal usa Q3_K_M come default per garantire spazio a tutto lo stack (LLM + embeddings + vector DB + app).
Con imatrix, anche Q2_K è un'opzione valida per scenari a memoria molto limitata.
💻 CPU Only
RAM disponibile
Modello
16 GB+
Q4_K_M
8-12 GB
Q3_K_M
< 8 GB
Q2_K
📥 Download
bash
1# ⭐ Consigliato per la maggior parte degli utenti2huggingface-cli download Sophia-AI/Qwen3-4B-Instruct-2507-GGUF \3 Qwen3-4B-Instruct-2507-Q4_K_M.gguf
45# 🔥 Per Sophia Metal / Edge devices6huggingface-cli download Sophia-AI/Qwen3-4B-Instruct-2507-GGUF \7 Qwen3-4B-Instruct-2507-Q3_K_M.gguf
89# Massima qualità10huggingface-cli download Sophia-AI/Qwen3-4B-Instruct-2507-GGUF \11 Qwen3-4B-Instruct-2507-Q6_K.gguf
🚀 Utilizzo
llama-cpp-python
python
1from llama_cpp import Llama
23llm = Llama.from_pretrained(4 repo_id="Sophia-AI/Qwen3-4B-Instruct-2507-GGUF",5 filename="*Q4_K_M.gguf",6 n_ctx=4096,7 n_gpu_layers=-1,# -1 = tutte le layers su GPU8)910response = llm.create_chat_completion(11 messages=[12{"role":"user","content":"Ciao, come stai?"}13]14)15print(response["choices"][0]["message"]["content"])
Tool calling
python
1response = llm.create_chat_completion(2 messages=[3{"role":"user","content":"What's the weather in Rome?"}4],5 tools=[{6"type":"function",7"function":{8"name":"get_weather",9"description":"Get weather for a city",10"parameters":{11"type":"object",12"properties":{13"city":{"type":"string"}14},15"required":["city"]16}17}18}]19)