Views
No views yet
checkpoints/final.pt: checkpoint PyTorchtokenizer/kai_tokenizer.model: tokenizer SentencePiecetokenizer/kai_tokenizer.vocab: vocabularioconfigs/kai_antcore.generated.yaml: config usada no treinotraining_history.json: historico de loss, se disponivel1{
2 "global_step": 7630,
3 "tokens_seen": 2000158720,
4 "best_eval_loss": 2.5984683084487914,
5 "model_config": {
6 "name": "KAI-AntCore-118M",
7 "hidden_dim": 768,
8 "num_layers": 12,
9 "num_heads": 12,
10 "num_kv_heads": 4,
11 "intermediate_dim": 2688,
12 "vocab_size": 32000,
13 "max_seq_len": 2048,
14 "rope_base": 10000.0,
15 "rms_norm_eps": 1e-05,
16 "dropout": 0.0,
17 "tie_embeddings": true
18 },
19 "training_config": {
20 "optimizer": "adamw",
21 "lr": 0.0003,
22 "min_lr": 3e-05,
23 "weight_decay": 0.1,
24 "beta1": 0.9,
25 "beta2": 0.95,
26 "grad_clip": 1.0,
27 "warmup_steps": 457,
28 "lr_schedule": "cosine",
29 "total_steps": 7630,
30 "batch_size": 16,
31 "gradient_accumulation": 8,
32 "seq_length": 2048,
33 "precision": "bf16",
34 "seed": 42,
35 "save_every": 250,
36 "eval_every": 250,
37 "log_every": 20,
38 "trail_loss": {
39 "enabled": true,
40 "offsets": [
41 2,
42 4,
43 8
44 ],
45 "weight": 0.12
46 }
47 }
48}python test_kai.py --checkpoint checkpoints/final.pt --tokenizer tokenizer/kai_tokenizer.model