Views
No views yet
qwen3_5 / Qwen3_5ForConditionalGeneration.MooreMuaMu/qwen35-27b-ancient-rl-r32-step250-lora.1import torch
2from transformers import AutoProcessor, Qwen3_5ForConditionalGeneration
3
4repo_id = "MooreMuaMu/qwen35-27b-ancient-rl-r32-step250"
5model = Qwen3_5ForConditionalGeneration.from_pretrained(
6 repo_id,
7 dtype=torch.bfloat16,
8 device_map="auto",
9)
10processor = AutoProcessor.from_pretrained(repo_id)step300, step350, step400, step450) for model selection: held-out quality degraded at step300 and collapsed after step350./blob/models/qwen35-27b-ancient-stage2/checkpoint-227-merged/blob/experiments/ancient-swift-rl-stage2/qwen35_27b_ckpt227_uy_mn_bo_ta_full_r32_lr1e4/v0-20260811-070520/checkpoint-25032/320.051e-40.0010.7, top-p 0.95, n=1, seed 42.
Prompt-level paired bootstrap: 10,000 samples, seed 20260811.| Metric | Delta vs base |
|---|---|
| Exact | +0.0400 CI [+0.0033,+0.0800] |
| Char-F1 | +0.0539 CI [+0.0160,+0.0910] |
| BERTScore-F1 | +0.0631 CI [+0.0330,+0.0942] |
| Semantic composite | +0.0555 CI [+0.0222,+0.0880] |
| Has ANS | +0.0667 CI [+0.0333,+0.1000] |
| Adapter has_ans | 0.9867 |
| SacreBLEU-2 corpus delta | +7.98 pp |
| SacreBLEU-2 sentence mean delta | +4.21 pp |
sacrebleu.metrics.bleu.BLEU(tokenize="zh", max_ngram_order=2, smooth_method="exp", effective_order=True) after extracting <ANS>...</ANS> from the completion.27,356,728,56054,713,457,12012model-00001-of-00012.safetensors: 2,542,796,928 bytesmodel-00002-of-00012.safetensors: 4,842,451,920 bytesmodel-00003-of-00012.safetensors: 4,965,227,944 bytesmodel-00004-of-00012.safetensors: 4,912,819,264 bytesmodel-00005-of-00012.safetensors: 4,986,198,544 bytesmodel-00006-of-00012.safetensors: 4,912,819,320 bytesmodel-00007-of-00012.safetensors: 4,932,703,272 bytesmodel-00008-of-00012.safetensors: 4,966,314,576 bytesmodel-00009-of-00012.safetensors: 4,964,162,248 bytesmodel-00010-of-00012.safetensors: 4,933,789,824 bytesmodel-00011-of-00012.safetensors: 4,965,228,032 bytesmodel-00012-of-00012.safetensors: 2,789,094,896 bytes