Views
No views yet
| Domain | Paper review |
| Architecture | Qwen3_5ForCausalLM — 32 layers, hidden 4096 |
| Precision | bf16 (merged from FSDP via verl.model_merger) |
| Notes | NEGATIVE RESULT: V2RECLAIM (train policy on its own evolved-harness grading) collapsed to 0.50. Kept for the record. |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2tok = AutoTokenizer.from_pretrained("hyunseoki/mh-v1b-pr-9b-reclaim-neg")
3model = AutoModelForCausalLM.from_pretrained("hyunseoki/mh-v1b-pr-9b-reclaim-neg", torch_dtype="bfloat16")