Views
No views yet
ibm-granite/granite-3.0-1b-a400m-instruct fine-tuned with PRIME-RL's SFT trainer on the willcb/V3-wordle dataset.step_200/ includes tokenizer files and pytorch_model.bin for inference or warm-starting downstream RL experiments.CUDA_VISIBLE_DEVICES=0 uv run sft @ examples/wordle/sft/granite_train.toml \
--output-dir outputs/granite_wordle_sft_200 \
--max-steps 200 \
--weights.interval 10 \
--ckpt.interval 50 \
--ckpt.keep 20