Views
No views yet

Q4_2_H (Bloco 24), Crivo de Roda Modulo 420 e Amostrador Áureo.
llama.cpp / GGML, projetado para integrar avanços da Teoria Aritmético-Harmônica de Becker ao pipeline de inferência de Modelos de Linguagem de Grande Porte (LLMs).GGML_TYPE_Q4_2_H (LLAMA_FTYPE_MOSTLY_Q4_2_H), padronizado para um tamanho de bloco exato de 24 elementos (QK_Q4_2_H = 24). Essa especificação resolve matematicamente os problemas de divisibilidade em arquiteturas modernas (1536, 2048, 4096, 6912, 8192 dimensões ocultas), reduzindo o erro médio quadrático (RMSE) de reconstrução de tensores sem comprometer a densidade de memória.CMakeLists.txt e cmake/git-vars.cmake foram ajustadas para não interromper a compilação nem forçar tags -dirty quando o código-fonte for modificado fora de uma árvore Git padrão.server.ts):
QK = 24)Q4_0 e fragmentação de memória.QK_Q4_2_H = 24:1typedef struct {
2 ggml_fp16_t d; // Scale do bloco FP16 (2 bytes)
3 uint8_t qs[12]; // 24 nibbles de 4-bits empacotados (12 bytes)
4} block_q4_2_h;
5
6static_assert(sizeof(block_q4_2_h) == 14, "block_q4_2_h must be 14 bytes");Q4_0 (4.50 bpw) e Q4_1 (5.00 bpw).llama.cpp| Arquivo | Localização | Descrição da Modificação |
|---|---|---|
ggml-common.h | llama.cpp/ggml/src/ | Define #define QK_Q4_2_H 24 e atualiza a struct block_q4_2_h para qs[12] (14 bytes). |
ggml-quants.c | llama.cpp/ggml/src/ | Atualiza rotinas C quantize_row_q4_2_h_ref, dequantize_row_q4_2_h e quantize_q4_2_h para bloco 24. |
ggml.c | llama.cpp/ggml/src/ | Registra a tabela de tipos em [GGML_TYPE_Q4_2_H] com .blck_size = 24, .type_size = 14. |
ggml-quants.h | llama.cpp/ggml/src/ | Declarações de interface para os kernels de quantização helicoidal C. |
ggml.h | llama.cpp/ggml/include/ | Registra as enums GGML_TYPE_Q4_2_H = 43 e GGML_FTYPE_MOSTLY_Q4_2_H = 29. |
llama.h | llama.cpp/include/ | Adiciona a enumeração pública LLAMA_FTYPE_MOSTLY_Q4_2_H = 42. |
llama-model-loader.cpp | llama.cpp/src/ | Associa LLAMA_FTYPE_MOSTLY_Q4_2_H à descrição "Q4_2_H - Helicoidal Q_24". |
llama-quant.cpp | llama.cpp/src/ | Adiciona regras de validação e permissão de conversão para Q4_2_H. |
quantize.cpp | llama.cpp/tools/quantize/ | Registra a flag "Q4_2_H" no utilitário de linha de comando llama-quantize. |
convert_hf_to_gguf.py | llama.cpp/ | Suporte ao argumento --outtype q4_2_h para conversão direta Hugging Face $\to$ GGUF. |
base.py | llama.cpp/conversion/ | Mapeia a constante MOSTLY_Q4_2_H no pipeline de escrita de arquivos GGUF v3. |
constants.py | llama.cpp/gguf-py/gguf/ | Adiciona Q4_2_H = 43 e MOSTLY_Q4_2_H = 42 no pacote Python gguf. |
server.ts | Raiz da Aplicação | Atualiza logs do simulador e endpoints da API para medição de RMSE com bloco 24. |
| Métrica | Q4_0 Padrão | Q4_2_H (Bloco 42 Incompatível) | Q4_2_H ΩFFΣLLIα (Bloco 24) |
|---|---|---|---|
Tamanho do Bloco (QK) | 32 pesos | 42 pesos | 24 pesos |
Tamanho da Estrutura (sizeof) | 18 bytes | 24 bytes | 14 bytes |
| Bits por Peso (BPW) | 4.50 bpw | 4.57 bpw | 4.67 bpw |
| Compatibilidade de Colunas | Sim | Incompatível (fallbacks) | 100% Compatível (zero fallbacks) |
| Redução de Erro RMSE vs Q4_0 | Linha de base | ~3.2% | ~5.8% de melhoria |
llama.cpp Otimizado1cd llama.cpp
2mkdir -p build && cd build
3cmake .. -DLLAMA_BUILD_EXAMPLES=ON
4cmake --build . --config Release -j$(nproc)Q4_2_H1python3 llama.cpp/convert_hf_to_gguf.py path/to/hf-model \
2 --outtype q4_2_h \
3 --outfile models/modelo-q4_2_h.gguf./llama.cpp/build/bin/llama-quantize ./models/modelo-f16.gguf ./models/modelo-q4_2_h.gguf Q4_2_H./llama.cpp/build/bin/llama-cli -m ./models/modelo-q4_2_h.gguf -p "ΩFFΣLLIα: Explique a Teoria Helicoidal" -n 2561npm run build
2npm start