Views
No views yet
v34c55u8) hosted side-by-side for comparison.jensjepsen/danish-lm-400m-sft-v31-avg-top3
on a 50/25/25 mix of Danish instruction-following, gsm8k, and json-verify
prompts, with DAPO-fresh dynamic resampling and TRL 1.10 + vLLM 0.19.1 colocate.jensjepsen/danish-lm-400m-sft-v31-avg-top3GRPO_DAPO_RESAMPLE=1 GRPO_DAPO_FRESH_PROMPTS=1 GRPO_DAPO_FRESH_MATCH_TASK=1)jensjepsen/danish-if-grpo-combined-v2 — 10k prompts, 46 our + Google IFEval schema constraints, cartesian surface variation#### N verificationjensjepsen/danish-json-grpo-v1 — schema-verifier rewardinterleave_datasets(stopping_strategy="all_exhausted") — no subsampling| subfolder | step | in-training composite | notes |
|---|---|---|---|
step-14375 | 14375 | 2.177 | in-training top-1 |
step-14125 | 14125 | 2.169 | in-training top-2 |
step-17750 | 17750 | 2.168 | in-training top-3 |
| eval / metric | v31-avg-top3 (base) | step-14375 (top-1) | step-14125 (top-2) | step-17750 (top-3) |
|---|---|---|---|---|
| IFEval-DA prompt-strict | 21.2 | 36.2 | 39.0 | 41.4 |
| IFEval-DA prompt-loose | 22.0 | 37.1 | 39.5 | 42.3 |
| IFEval-DA inst-strict | 35.2 | 51.9 | 56.3 | 56.5 |
| IFEval-DA inst-loose | 35.8 | 52.7 | 57.3 | 57.8 |
| IFBench-DA prompt-strict | – | 10.7 | 10.0 | 10.3 |
| IFBench-DA prompt-loose | – | 16.7 | 16.0 | 15.7 |
| IFBench-DA inst-strict | – | 12.8 | 11.6 | 12.5 |
| IFBench-DA inst-loose | – | 18.0 | 17.4 | 17.7 |
| GSM8K-DA pass@1 | 17.39 | 27.26 | 28.78 | 26.58 |
| SciQ-DA open-Q pass@1 | 13.50 | 13.70 | 13.60 | 13.30 |
| SciQ-DA MC-letter | – | 58.50 | 59.70 | 59.40 |
| Citizen-DA gen | 29.86 | 29.6 | 29.6 | 28.3 |
| Citizen-DA MC | 48.19 | 47.1 | 47.1 | 48.9 |
| ARC-Easy-DA chat-MC | 44.40 | 40.24 | 40.82 | 40.82 |
| ARC-Challenge-DA chat-MC | 29.35 | 28.58 | 28.16 | 28.07 |
| OpenBookQA-DA chat-MC | 35.40 | 34.20 | 33.40 | 35.20 |
| PIQA-DA chat-MC | 53.00 | 49.00 | 50.00 | 57.00 |
| Textman-DA summary chrF++ | 41.11 | 41.06 | 40.57 | 41.69 |
| Textman-DA rewrite chrF++ | 46.51 | 44.45 | 44.76 | 44.37 |
step-17750 for IFEval / instruction-following, step-14125 for GSM8K, and step-14375 for IFBench specifically. Or model-soup the three for a balanced ckpt.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3REPO = "jensjepsen/danish-lm-400m-grpo-v34c55u8"
4SUBFOLDER = "step-17750" # or step-14125 / step-14375
5
6tok = AutoTokenizer.from_pretrained(REPO, subfolder=SUBFOLDER)
7model = AutoModelForCausalLM.from_pretrained(REPO, subfolder=SUBFOLDER, dtype="bfloat16")
8
9prompt = "<|user|>Skriv en kort tekst om Kaj Munk.<|end|><|assistant|>"
10ids = tok.encode(prompt, return_tensors="pt").to(model.device)
11out = model.generate(ids, max_new_tokens=256, do_sample=False,
12 eos_token_id=tok.convert_tokens_to_ids("<|end|>"))
13print(tok.decode(out[0], skip_special_tokens=False))<|user|>{prompt}<|end|><|assistant|>{answer}<|end|> (same as v31 base)