125M legal SLM aligned with
RLAIF (RL from AI feedback). A Bradley-Terry
reward model was trained on ~681 AI-written preference pairs, then the closed-book
QA policy (
slm-125m-qa) was
improved by
best-of-N reward-weighted SFT: sample N answers per prompt, keep
the reward-model's top pick, fine-tune on the winners.