Views
No views yet
Qwen/Qwen3-4B-Instruct-2507, trained on the same Thai-focused
4,147-record corpus as the 8B variant. Designed for deployment to mobile / edge / Typhoon-S-like
small-device targets.| benchmark | Kanitakorn-4B-SFT | Kanitakorn-8B-SFT (for ref) | Typhoon-S-8B (for ref) |
|---|---|---|---|
| ThaiExam (n=165) | 0.418 | 0.503 | 0.467 |
| MATH500-TH | 0.467 | 0.533 | 0.400 |
| IFEval-TH strict | 0.733 | 0.667 | 0.733 |
| IFEval-TH loose | 0.767 | 0.744 | 0.789 |
| OpenThaiEval MCQ | 0.400 | 0.267 | 0.267 |
| AIME24 | 0.067 | 0.033 | 0.000 |
| AIME25 | 0.067 | 0.000 | 0.000 |
| HotpotQA EM | 0.200 | 0.200 | 0.133 |
| MT-Bench-TH | 3.6 | 4.5 | 7.8 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = "Qwen/Qwen3-4B-Instruct-2507"
5adapter = "Jnx03/kanitakorn-qwen3-4b-sft-v1"
6tok = AutoTokenizer.from_pretrained(base, trust_remote_code=True)
7model = AutoModelForCausalLM.from_pretrained(base, torch_dtype="bfloat16", device_map="auto")
8model = PeftModel.from_pretrained(model, adapter).merge_and_unload()