Views
No views yet
phase_c is the final model.
v1 baseline: Chess-Nut-Engine/chess-qwen35-0.8b-sft-abc-20260708.| KPI | v1-C | v2-C |
|---|---|---|
| GSM8K (general reasoning, greedy) | 0.5% | 41.0% (base model: 53%) |
| rollout diversity (distinct moves/8 @ T0.8) | 0.625 | 0.687 |
| legal_moves on in-check positions | 27.2% | 49.8% |
| legality_check (gate) | 94.8% | 96.8% |
| legal_moves overall | 87.0% | 83.3% |
| WPD (lower better) | 0.435 | 0.469 |
docs/experiments/2026-07-09_v2_run/README.md.1from transformers import AutoModelForCausalLM, AutoTokenizer
2m = AutoModelForCausalLM.from_pretrained(
3 "Chess-Nut-Engine/chess-qwen35-0.8b-sft-v2-20260709",
4 subfolder="phase_c", trust_remote_code=True)
5t = AutoTokenizer.from_pretrained(
6 "Chess-Nut-Engine/chess-qwen35-0.8b-sft-v2-20260709",
7 subfolder="phase_c")<move>/</move> are tokenizer special tokens. Planning prompts use the
<think>...</think><move>uci</move> protocol.