Views
No views yet
student allenai/Olmo-3-7B-Think-SFT vocab 100278
teacher Qwen/Qwen3-32B (TP4, vLLM) vocab 151669 ← 跨分词器
dataset DAPO-Math-17k (english)
cut_mode prefix, K = 1024 学生写 1024 token 被切断
teacher_max_tokens 1024 教师从切点续写 1024
lr 1e-5 constant warmup 0
batch train 64 × n 4 = 256 序列/更新 1 次更新/步
steps 220 (= 14116/64, 一个 epoch) 171 s/step, 9h02m
attn sdpa, use_remove_padding=False 该环境无 flash_attn| AIME25 | HMMT25 | |
|---|---|---|
| Qwen3-32B 教师 | 0.7125 | 0.5042 |
| Olmo-3-7B 基线 | 0.5917 | 0.4167 |
| ROSE 30 步 | 0.5750 | 0.3854 |
| 本模型 (ROSE 220 步) | 0.5583 | 0.3688 |
TEACHER_MAX_TOKENS=1024, 而实测 actor/ce_target_tokens 平均 960
(占预算 93.8%; 同期 Qwen3-4B 那条是 1016, 99.2%)—— 教师几乎每一条都是
写到预算耗尽被截断, 从不自己收尾。而学生完整推理链平均 16000-18600 token。[prompt] [学生前缀 1024] [教师续写 ~960] ...... 还有 ~15000 token 从没被监督过
^^^^^^^^^^^^^^ CE 只打在这里rose_agent_loop 的通路(TEACHER_TOKENIZER 非 null 即启用):
学生前缀 ids → decode 成文本 → 套教师的 chat template → 教师续写 →
取回 text → 用学生的 tokenizer 重新 encode。<think>。
格式错位是良性的 —— Olmo 模板在 prompt 末尾就打开 <think>, Qwen3 模板停在
assistant\n, 教师看到「assistant\n + 推理文字」, 续写出的 </think>+答案
接在学生的 <think> 之后正好构成 Olmo 期望的格式。| K | teacher 预算 | 覆盖位置 | |
|---|---|---|---|
| 本模型 | 1024 | 1024 | 链的 6-12% |
| 建议 | 8192 | 4096 | 链的 48-72%, 能写到 </think> |
use_remove_padding=False。