Qwen3-1.7B SFT on Qwen3-32B SciWorld rollouts
Qwen3-1.7B 在 Qwen3-32B 自采的 SciWorld 多轮轨迹上做行为克隆(全量,不按成功率筛选)。
数据
- 任务集:
AgentGym/AgentGym-RL-Data-ID 的 train/sciworld_train.json(2120 个 item_id)
- 采样: Qwen3-32B, TP=8, greedy(temp 0), 每轮 ≤512 token, 每条 ≤20 轮, 50 环境并发 → 54 分钟(1.52 s/条)
- 教师自身表现(训练集): Score 0.4296 / Success 0.1307 / Pass(>0) 0.8967, 1901/2120 条拿到非零分
- 数据规模: 2120 条 × 平均 2064 token,其中有监督的 804 token/条(共 1.7M);
掩码规则同 AgentGym BC —— 只有 assistant 动作算 loss,system/user/observation 与预置的
"OK. I'll follow…" 全部 -100
训练
verl FSDP SFT, 8×H100, 1 epoch, 66 步, 有效 batch 32, lr 1e-5, max_length 8192, bf16 —— 173 秒, 末步 loss 0.430
评测(AgentGym 口径: AgentGym/AgentEval 的 sciworld_test.json 200 题, ≤20 轮, greedy, nothink)
| 模型 | Score | Success | Pass(>0) | 平均轮数 |
|---|
| Qwen3-1.7B 基座 | 0.0479 | 0.0000 | 0.1650 | 19.5 |
| 本模型(SFT on 32B) | 0.2077 | 0.0450 | 0.4100 | 17.9 |
| Qwen3-32B 教师 | 0.4346 | 0.1100 | 0.9350 | 17.0 |
Score = 平均完成度(SciWorld 的 0~100 分归一化); Success = 完整完成;
Pass 用 AgentGym-RL 的 Pass@n = max(score) > 0 定义(拿到任何部分分即算)。