Views
No views yet

| Parâmetros | 536,5M (embeddings amarrados) |
| Arquitetura | Qwen3 (GQA 10Q/2KV, head_dim 128, QK-norm) |
| Camadas / hidden | 28 / 1280 |
| Vocabulário | 32.000 (BPE próprio, treinado no corpus pt-BR) |
| Contexto | 1024 (RoPE θ=1M, posições até 4096) |
| Tokens de treino | 17.187.749.888 |
| Precisão | bf16 |
| Hardware | TPU v5e-8 (Kaggle), sessões de fim de semana |
| Framework | JAX + optax + orbax, pipeline próprio com ZeRO-1 |
<pad>=0, <unk>=1, <s>=2, </s>=3, <doc>=41import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4tok = AutoTokenizer.from_pretrained("henriqueimoveis/Echoes-1-Base")
5model = AutoModelForCausalLM.from_pretrained("henriqueimoveis/Echoes-1-Base", dtype=torch.bfloat16).cuda()
6
7prompt = "A história dos fóruns brasileiros começou"
8ids = tok(prompt, return_tensors="pt").to("cuda")
9out = model.generate(**ids, max_new_tokens=200, do_sample=True, temperature=0.7, top_p=0.9)
10print(tok.decode(out[0], skip_special_tokens=True))