Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = "Qwen/Qwen3.6-27B"
5m = AutoModelForCausalLM.from_pretrained(base, dtype="bfloat16", device_map="auto")
6m = PeftModel.from_pretrained(m, "REPO_ID")
7tok = AutoTokenizer.from_pretrained(base)scripts/training/merge_lora_qwen36.py im
Projekt-Repo). Der direkte Tensor-Merge ist nötig, weil AutoModelForCausalLM bei
model_type: qwen3_5 nur den Sprachteil lädt — ein save_pretrained daraus verlöre die 333
Vision- und 15 MTP-Tensoren, und vLLM lädt das Repo dann nicht.--quantization fp8 (dynamisch, aus bf16). Das LoRA-Delta ist mit
0,49–0,59 % relativer Frobenius-Norm kleiner als der FP8-Quantisierungsfehler selbst — dass
es trotzdem durchschlägt, liegt daran, dass das Delta eine gerichtete Änderung ist und das
Quantisierungsrauschen ungerichtet. Der Nachweis ist die Messung oben, nicht die Norm. 4-Bit nicht verwenden — dabei geht das Delta
unter, das ist in diesem Projekt für ein anderes Modell gemessen worden.| Verfahren | Rejection-Sampling-SFT (QLoRA, NF4) |
| Daten | eigene Samples des Basismodells + GLM-5.2 als zweite Spur, beide durch denselben objektiven Verifier gefiltert |
| Ziele | q,k,v,o_proj + gate,up,down_proj, r=32, α=64, dropout 0,05 |
| Optimierung | lr 1e-4 cosine, warmup 4 %, effektive Batchgröße 8, seq 2048 |
| Hardware | 1× RTX PRO 6000 (96 GB) |
eval_v3: 159 stratifizierte Fragen, davon 36 mit dokumentierter Grundwahrheit
(24 Berichte mit gepflanztem Fehler, 12 unmögliche Daten/Signal-Paarungen). Der Grader ist
programmatisch, kein Richter. Gepaarter exakter McNemar-Test gegen dasselbe Basismodell.| Kriterium | Basis | Finetune | nur Basis | nur FT | p |
|---|---|---|---|---|---|
cost_model_valid | 64,2 % | 91,9 % | 8 | 42 | <0,001 |
capacity_present | 78,9 % | 93,5 % | 5 | 23 | 0,001 |
falsifiable | 82,9 % | 95,1 % | 3 | 18 | 0,001 |
schema_complete | 67,5 % | 83,7 % | 14 | 34 | 0,006 |
brevity | 84,3 % | 89,3 % | 2 | 10 | 0,039 |
sources_or_marked | 88,1 % | 88,7 % | 4 | 5 | 1,000 |
lookahead_guard | 98,7 % | 98,7 % | 0 | 0 | — |
flaw_detected (Grundwahrheit) | 83,3 % | 100 % | 0 | 4 | 0,125 |
infeasible_flag (Grundwahrheit) | 100 % | 100 % | 0 | 0 | — |
proxy_unmarked (niedriger besser) | 0 % | 0 % | 0 | 0 | — |
cost_model_valid, capacity_present und falsifiable klar signifikant;
schema_complete liegt mit p = 0,006 knapp darüber, brevity hält der Korrektur nicht stand.lookahead_guard ist musterbasiert und findet nur explizite Formen.