Views
No views yet
chat_template para evitar fallos comunes (como los generados por funciones Jinja no compatibles en inferencias locales).chat_template nativo de Gemma contenía funciones como raise_exception que rompen la inferencia en llama.cpp y UI locales. Este repositorio cuenta con un template limpio (GGUF F16) que soluciona los problemas de parseo. ¡Carga y listo!IQ2, IQ3, IQ4) han sido calibradas con un archivo imatrix.dat exhaustivo para minimizar al máximo la pérdida de coherencia.F16, Q8_0) hasta la eficiencia máxima para GPUs con poca VRAM (IQ2_XXS).| Archivo | Cuantización | Notas Recomendadas |
|---|---|---|
gemma-4-12b-it-F16.gguf | F16 | Archivo maestro original. Sin pérdida. Requiere +25GB RAM/VRAM. |
gemma-4-12b-it-Q8_0.gguf | Q8_0 | Calidad casi idéntica a F16. Excelente si tienes memoria suficiente (~13GB). |
gemma-4-12b-it-Q6_K.gguf | Q6_K | Muy buena calidad y tamaño equilibrado. Recomendado. (~10GB) |
gemma-4-12b-it-Q5_K_M.gguf | Q5_K_M | El punto óptimo entre gran calidad y buen rendimiento/velocidad. (~9GB) |
gemma-4-12b-it-Q4_K_M.gguf | Q4_K_M | [RECOMENDADO] Mejor balance tamaño/inteligencia. (~7.5GB) |
gemma-4-12b-it-IQ4_NL.gguf | IQ4_NL | Cuantización inteligente. Alta calidad y tamaño muy reducido usando Imatrix. |
gemma-4-12b-it-IQ3_M.gguf | IQ3_M | Excelente para exprimir tarjetas gráficas de poca VRAM (ej. 6GB). |
gemma-4-12b-it-IQ2_XXS.gguf | IQ2_XXS | Máxima compresión extrema para ejecución en hardware muy limitado. |
llama.cpp, Ollama, LM Studio o KoboldCPP deberían detectar automáticamente el formato de Gemma sin problemas de "jinja syntax error".1<start_of_turn>user
2Hola, ¿cómo estás?<end_of_turn>
3<start_of_turn>modelllama.cpp y convertidos en lotes cuidando que la información semántica se preserve incluso en los modelos IQX. Se procesaron usando Imatrix calibrado hasta el punto de saturación (chunk 120+).