Quantizações com imatrix (importance matrix) do modelo Qwen3.6-27B, otimizadas para língua portuguesa.
Sobre as Quantizações
Estes quants foram gerados usando o workflow de imatrix do llama.cpp, que calcula uma matriz de importância dos pesos do modelo antes de quantizar, preservando melhor a qualidade em formatos compactos.
Base
Modelo original: Qwen3.6-27B (BF16)
Ferramenta: llama.cpp — llama-quantize --imatrix
Dado de Treino do Imatrix
A matriz de importância foi calculada usando texto em língua portuguesa, incluindo:
Textos em português: literatura, artigos técnicos, documentos acadêmicos, conversas do dia a dia
Código Python: scripts, notebooks, documentação de bibliotecas
Conteúdo misto: prompts de IA, tutoriais, materiais didáticos
Isso significa que estas quantizações têm desempenho superior para tarefas em português e para geração de código Python, comparado a quants genéricos feitos com dados em inglês.
Arquivos
Arquivo
Tamanho Aprox.
Tipo de Quantização
Qwen3.6-27B-BF16-imatrix-pt-iq4_nl.gguf
~14.9 GB
IQ4_NL (Normalized 4-bit)
Qwen3.6-27B-BF16-imatrix-pt-q4_k_s.gguf
~14.7 GB
Q4_K_S (4-bit K-small)
Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf
~15.6 GB
Q4_K_M (4-bit K-medium)
Qwen3.6-27B-BF16-imatrix-pt-q5_k_s.gguf
~17.6 GB
Q5_K_S (5-bit K-small)
Qwen3.6-27B-BF16-imatrix-pt-q5_k_m.gguf
~18.2 GB
Q5_K_M (5-bit K-medium)
Recomendações de Uso
IQ4_NL: melhor relação qualidade/tamanho para uso geral
Q4_K_M: equilíbrio entre qualidade e memória (recomendado para GPUs com 16-24 GB VRAM)
Q5_K_M: máxima qualidade entre os quants disponíveis (recomendado para GPUs com 24+ GB VRAM)
Como Usar
Ollama
ollama run ./Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf
llama.cpp
./llama-cli -m Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf -n 512 --prompt "Olá, como vai?"