slm-125m-raft-rlaif
125m legal SLM with RAFT (retrieval-augmented fine-tuning, Zhang et al.
2024): base -> QA SFT -> instruction SFT -> RLAIF v2 -> RAFT. Trained on
~14k examples of golden passage + 3 distractors (golden position uniform,
20% no-golden refusals): answer from the right passage, ignore the noise,
refuse when the context lacks the answer.