Views
No views yet
monte-inc/qwen3.5-35b-a3b-banking-sft-vN). Render with training/common/hub_publish.py (Jinja2). See monte-inc/gemma4-26b-a4b-banking-sft-v3 for a fully-populated example.base_model — HF id, e.g. unsloth/Qwen3.5-35B-A3Bmodel_family — qwen3.5 | gemma4 | …domain — e.g. banking_knowledgeversion — e.g. v6training — dict with framework, framework_version, hardware, runtime, epochs, steps, seq_len, lr, lora_rank, lora_alpha, optim, lr_scheduler, warmup, data_filerepo_files — list of (name, size_human, note) tuplesinference — dict with vllm_command, tool_parser, reasoning_parserknown_issues — list of (title, body) tuples (rendered as nested sections; can be empty)eval — list of (model, pass_rate, note) rowseval_command — the literal tau2 run commandgit — dict with commit, branch, repo_url (e.g. https://github.com/Monte-Inc/tau2-banking-sft)1---
2library_name: peft
3base_model: unsloth/Qwen3.6-35B-A3B
4tags:
5 - peft
6 - lora
7 - qlora
8 - qwen3.6
9 - tau2-bench
10 - banking
11 - tool-calling
12license: apache-2.0
13pipeline_tag: text-generation
14---unsloth/Qwen3.6-35B-A3B trained on the tau2-bench banking v2 data (Claude Opus/Sonnet + GPT-5.2 trajectories with reasoning traces).training/run_qwen_sft.py in tau2-banking-sft@adc8c0e35076d078494008976d6bd0c40f58fa12adapter_model.safetensors (see HF) — PEFT LoRA weightsadapter_config.json (small) — r=32, target_modules + target_parameterschat_template.jinja (small) — qwen3.6 native templatetokenizer.json + tokenizer_config.json (small) — qwen3.6 tokenizertrainer_state.json (small) — step-by-step loss + grad-norm + LR historytraining_args.json (small) — exact SFTConfig used1python -c "
2from unsloth import FastLanguageModel
3from peft import PeftModel
4model, tok = FastLanguageModel.from_pretrained('unsloth/Qwen3.6-35B-A3B', max_seq_length=8192, load_in_4bit=False)
5model = PeftModel.from_pretrained(model, 'monte-inc/qwen3.6-35b-a3b-banking-sft-v9')
6model = model.merge_and_unload()
7model.save_pretrained_merged('./merged-v9', tok, save_method='merged_16bit')
8"1vllm serve ./merged-v9 \
2 --served-model-name qwen3.6-banking-sft \
3 --host 0.0.0.0 --port 8000 \
4 --dtype bfloat16 \
5 --max-model-len 100000 \
6 --gpu-memory-utilization 0.90 \
7 --enable-auto-tool-choice \
8 --tool-call-parser qwen3_xml \
9 --reasoning-parser qwen3 \
10 --enforce-eagerbanking (gpt-5.2 user sim, terminal_use)| Run | Pass rate |
|---|
monte-inc/qwen3.6-35b-a3b-banking-sft-v9 (this model) | TBD |1tau2 run --domain banking \
2 --agent-llm openai/qwen3.6-banking-sft \
3 --agent-llm-args '{"api_base":"http://localhost:8000/v1","temperature":0.0}' \
4 --user-llm gpt-5.2 \
5 --retrieval-config terminal_use \
6 --max-concurrency 10 --num-trials 4 --max-steps 200 \
7 --seed 42 --max-retries 3 \
8 --save-to qwen3.6-banking-sft-v9https://github.com/Monte-Inc/tau2-banking-sft@adc8c0e35076d078494008976d6bd0c40f58fa12 on branch main.