Views
No views yet
Qwen3-8B-Base for tau-bench agentic tool-use, trained with
slime (Megatron-LM training + SGLang rollout).Qwen3-8B-Base → SFT on tau-bench trajectories (TauSFT) → RL on tau-bench (Tau).torch_dist format to
Hugging Face safetensors (bf16).| Base model | Qwen/Qwen3-8B-Base |
| Framework | slime (Megatron-LM + SGLang) |
| Task | tau-bench (tool-use dialogues) |
| User simulator | zai-org/GLM-4.7-Flash via an OpenAI-compatible endpoint |
| Precision | bfloat16 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "willhx/Qwen3-8B-Base-TauSFT-Tau"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="bfloat16", device_map="auto")