--jinja serve solo a llama.cpp; LM Studio e PocketPal leggono il template da soli.
Impostazioni consigliate
Temperature
0.6
Top-P
0.95
Top-K
20
Max tokens
2048 o più
Contesto
8192 (fino a 32768)
Il max-tokens alto non è opzionale. È un modello thinking: apre <think>
e ragiona prima di rispondere. Con un limite basso esaurisce i token mentre sta
ancora pensando e sembra che non risponda.
Cosa aspettarsi, onestamente
Sinythos 5.5
Mini
Dimensione
17,7 GB
709 MB (25× più piccolo)
Parametri
30B (3,3B attivi)
1,7B
Gira su
PC con 24 GB RAM
telefono
Il Mini non è più potente del modello grande — ha 1/18 dei parametri, e
nessuna quantizzazione o fusione può cambiarlo. Quello che è: il massimo
ottenibile in 709 MB, con lo stesso comportamento — ragiona prima di rispondere,
ammette quando non sa, verifica invece di inventare.
Dove rende meglio: domande dirette, riformulazioni, estrazione da testo, script
brevi, conversazione multilingue. Dove serve il grande: codice complesso,
conoscenza specialistica, testi lunghi curati.
E c'è un vantaggio che il grande non ha: funziona offline in tasca.
Le sei leggi
Ragiona, poi rispondi — nella lingua di chi scrive
Se non sai, vai a scoprirlo
I giochi hanno geometria vera
Il software si consegna animato e con i suoi asset
I 310 tensori sono byte-identici alla quantizzazione base di Qwen3-1.7B,
verificati singolarmente. Nessun training, nessuna distillazione: cambiano solo
i metadati.
Licenza
Pesi Apache 2.0 (opera derivata di Qwen3-1.7B) — vedi LICENSE e NOTICE.
Runtime MIT.