Views
No views yet
llama.cpp GGUF builds of aac-board-generator-770m-ptbr
— a 771.6M Brazilian-Portuguese multi-function AAC model that drafts pictogram-board word lists and follows
in-assistant board-editing instructions (add / remove / generate N), on CPU. See the
model card for what it does, training, and
evaluation.| File | Quant | Size | Notes |
|---|---|---|---|
aac-board-generator-770m-ptbr-Q4_K_M.gguf | Q4_K_M | 561 MB | smallest; slight quality drop |
aac-board-generator-770m-ptbr-Q5_K_M.gguf | Q5_K_M | 606 MB | good size/quality balance |
aac-board-generator-770m-ptbr-Q6_K.gguf | Q6_K | 766 MB | near-lossless |
aac-board-generator-770m-ptbr-Q8_0.gguf | Q8_0 | 824 MB | recommended — safe near-lossless |
aac-board-generator-770m-ptbr-f16.gguf | f16 | 1.55 GB | full precision reference |
llama-server -m aac-board-generator-770m-ptbr-Q8_0.gguf -t 4 -c 2048 --host 127.0.0.1 --port 8080/completion:1import requests
2INSTR = ("Você monta pranchas de CAA (pictogramas, pt-BR). Para o PEDIDO, liste ~12 itens concretos e relevantes, "
3 "um por linha, no formato palavra|tipo|sinônimos (tipo: v/s/a/e/l/p). Só a lista.")
4pedido = "monta uma prancha de brincar no parquinho"
5prompt = f"<start_of_turn>user\n{INSTR}\n\nPEDIDO: {pedido}<end_of_turn>\n<start_of_turn>model\n"
6print(requests.post("http://127.0.0.1:8080/completion",
7 json={"prompt": prompt, "temperature": 0, "n_predict": 320}).json()["content"])temperature 0). Output is one item per line, word|type|synonyms.tokenizer.json path, which tokenizes identically to the original — so the quantized model reproduces the
untrimmed parent's outputs. Verified: identical token counts and identical boards vs. the fp16 reference.