olmo3-7b_solver_iter3
SCOPE solver checkpoint trained with DR-Zero long-form GRPO.
- Model alias:
olmo3-7b
- Base model:
OLMo-3-7B-Instruct
- Version:
v1.9.21
- Solver iteration:
3
- Global step:
60
- Source experiment:
long_solver_v1.9.21_iter3_grpo_group8_olmo-3-7b-instruct
- Source local HF checkpoint:
checkpoints/dr-zero/long_solver_v1.9.21_iter3_grpo_group8_olmo-3-7b-instruct/merged_hf_actor_gs60
- Collection: https://huggingface.co/collections/wckwan/scope
This repository contains the Hugging Face-format checkpoint files for loading with Transformers.