Views
No views yet
reward_mode=ctrf_only).| Field | Value |
|---|---|
| Base model | openai/gpt-oss-20b |
| Init adapter | lilyzhng/gpt-oss-20b-tb2-sft-lora |
| Modal checkpoint | t33b-ctrf_only-train-13steps |
| LoRA rank | 32 |
1vllm serve openai/gpt-oss-20b --enable-lora --enable-mixed-moe-lora-format \
2 --lora-modules '{"name":"tb2-grpo","path":"lilyzhng/gpt-oss-20b-tb2-grpo-lora","is_3d_lora_weight":false}' \
3 --trust-remote-code