Views
No views yet
model=d26_r10), sequence length 2048,
9,184,215,040-token stream; trained on 8×H200 on charmander.41de86425450676dc4d5702fd2955d8fd734331a, config
conf/data/pirate2x2_50_75.yaml (export/conversion code ran at commit
287693b684ec8bc73d4af219bd59ee7b3bbaf2ef), arm hash cdab6ab6117e, checkpoint step
8,758.ppriors/hf_export/convert.py (bf16 safetensors, custom
trust_remote_code modeling files). Logit/tokenizer/bpb/KV-cache
equivalence against the nanochat checkpoint verified on GPU: logit max abs
diff 0.00e+00; converted val bpb 0.722292 (training-time record
0.722278). Results in verify_results.json, uploaded alongside the
model on HF.trust_remote_code=True. Experiment registry: exp-074
(pretraining-priors project). Sibling instruction-SFT model:
jkminder/pretraining-priors-pirate2x2-d26-w50-75-sft.