olmo3-7b_solver_iter2
SCOPE solver checkpoint trained with DR-Zero long-form GRPO.
- Model alias:
olmo3-7b
- Base model:
OLMo-3-7B-Instruct
- Version:
v1.9.21
- Solver iteration:
2
- Global step:
40
- Source experiment:
long_solver_v1.9.21_iter2_grpo_group8_olmo-3-7b-instruct
- Source local HF checkpoint:
checkpoints/dr-zero/long_solver_v1.9.21_iter2_grpo_group8_olmo-3-7b-instruct/merged_hf_actor_gs40
- Collection: https://huggingface.co/collections/wckwan/scope
This repository contains the Hugging Face-format checkpoint files for loading with Transformers.