Views
No views yet
Qwen/Qwen2.5-Coder-7B-Instruct produced by SFT distillation
from DeepSeek-V4-Pro traces on the BIRD text-to-SQL benchmark. Adapter rank 16,
~23M trainable parameters.| Model | pass@1 | Δ baseline |
|---|---|---|
| This adapter (SFT-V4Pro iter-50) | 55.00% | +7.50 pp |
| Qwen2.5-Coder-7B-Instruct (baseline) | 47.50% | — |
1from mlx_lm import load, generate
2from mlx_lm.sample_utils import make_sampler
3
4# Download the adapter directory
5from huggingface_hub import snapshot_download
6adapter_path = snapshot_download(repo_id="AbhiPoluri/qwen25-coder-7b-bird-sft-v4pro")
7
8# Load base + adapter
9model, tokenizer = load(
10 "Qwen/Qwen2.5-Coder-7B-Instruct",
11 adapter_path=adapter_path,
12)
13sampler = make_sampler(temp=0.0)
14
15prompt = tokenizer.apply_chat_template(
16 [
17 {"role": "system", "content": "You are an expert at writing SQLite queries. ..."},
18 {"role": "user", "content": "<schema>\n\n<question>"},
19 ],
20 tokenize=False,
21 add_generation_prompt=True,
22)
23print(generate(model, tokenizer, prompt=prompt, max_tokens=1024, sampler=sampler))Qwen/Qwen2.5-Coder-7B-Instructdeepseek/deepseek-v4-pro via OpenRouterVal loss progression:
Iter 1: 0.929 (initial)
Iter 50: 0.781 ← best, used for the 55.00% number above
Iter 100: 0.825
Iter 300: 1.046 (overfit, worse than starting)