FS-DFM 1.3B trained with ESPO mu=8 (ELBO-based Sequence-level Policy Optimization). First RL method to improve FS-DFM over SFT: 87.1% nonzero rate / 0.198 average reward on 124 test tasks (+18.6pp over SFT). Only ELBO-based methods generalize to DFM architectures.
1@article{brillian2026flowgrpo,
2 title={Concentrate or Collapse: When Reinforcement Learning Meets Diffusion Language Models for Web Planning},
3 author={Brillian, Muhammad Enrizky},
4 year={2026}
5}