Views
No views yet
sfanm/d24-pretrain-v2-climbmix-13B (13.1B-token ClimbMix WSD pretrain).sfanm/d24-midtrain-olmo3-5b — a 5.3B-token chunked subsample of the OLMo-3 Dolmino mix (long docs split into ≤2048-token windows, so olmOCR-PDF + reasoning-trace components are kept at true OLMo-3 proportions).sfanm/d24-sft-v2-olmo3-5b (chat; greedy GSM8K 4.62 / MMLU 35.1 / ARC 37.0), which RLOO then lifts to GSM8K 11.07.1from transformers import AutoModelForCausalLM, AutoTokenizer
2tok = AutoTokenizer.from_pretrained("sfanm/d24-midtrain-v2-olmo3-5b")
3model = AutoModelForCausalLM.from_pretrained("sfanm/d24-midtrain-v2-olmo3-5b")