Views
No views yet
| Source | Samples | Description |
|---|---|---|
| DBBench v1-v4 (RLVMR tagged) | ~3,060 | Multi-turn SQL agent trajectories |
| DBBench v4 (upsampled) | ~1,000 | Additional v4 samples |
| LogicCat (RLVMR tagged) | ~4,030 | Single-turn MySQL CoT (MIT license) |
| ALFWorld v5 (RLVMR tagged) | ~2,500 | Household task trajectories |
| ALFWorld v4 (RLVMR tagged) | ~2,500 | Household task trajectories |
| ALFWorld v3 (RLVMR tagged) | ~1,000 | Household task trajectories |
| Total | ~14,090 | DBBench ~57% / ALFWorld ~43% |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base = "Qwen/Qwen3-4B-Instruct-2507"
6adapter = "Kaito-F/qwen3-4b-sft-v13-mixed-rlvmr"
7
8tokenizer = AutoTokenizer.from_pretrained(base)
9model = AutoModelForCausalLM.from_pretrained(
10 base,
11 torch_dtype=torch.float16,
12 device_map="auto",
13)
14model = PeftModel.from_pretrained(model, adapter)