Views
No views yet
| What | v3 | v4 |
|---|---|---|
| Effective training examples | ~100 (66% silently dropped) | 270 (all 3 views working) |
| Eval integrity | Leaked (eval = training data) | Clean (10 held-out tasks, zero overlap) |
| Eval loss | 0.044 (meaningless) | 0.055 (real generalization) |
| Train loss | 0.059 | 0.199 (higher: bookend/chunk views are harder) |
| Best eval checkpoint | n/a | Epoch 8 (0.0547) |
| Parameter | Value |
|---|---|
| Base model | Qwen/Qwen3.5-397B-A17B (MoE, 17B active) |
| Hardware | 8x AMD Instinct MI355X (ROCm 7.2) |
| LoRA rank / alpha | 32 / 64 |
| Target modules | all (13 types incl. DeltaNet + MoE gate) |
| Trainable params | 128.5M / 396.9B (0.032%) |
| Dataset | 270 examples (3-view from 92 train trajectories, 10 held out for eval) |
| Cutoff length | 32,768 tokens |
| Epochs / Steps | 10 / 200 |
| Batch size | 8 (1 per device x 8 GPUs) |
| Learning rate | 2e-5 (cosine schedule) |
| Weight decay | 0.01 |
| Training time | 7h 59min |
| Merge method | LLaMA-Factory export (PEFT merge_and_unload on CPU) |
| Framework | LLaMA-Factory + DeepSpeed ZeRO-3 + PEFT 0.18.1 |
1python3 -m sglang.launch_server \
2 --model-path JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v4-merged \
3 --served-model-name Qwen3.5-397B-A17B-SFT-v4 \
4 --tp 8 \
5 --trust-remote-code \
6 --attention-backend triton \
7 --mem-fraction-static 0.80 \
8 --reasoning-parser qwen3 \
9 --tool-call-parser qwen3_coder \
10 --host 0.0.0.0 --port 300001python -m vllm.entrypoints.openai.api_server \
2 --model JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v4-merged \
3 --tensor-parallel-size 8 \
4 --trust-remote-code1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v4-merged")
4model = AutoModelForCausalLM.from_pretrained(
5 "JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v4-merged",
6 device_map="auto",
7 torch_dtype="bfloat16",
8)