LoRA adapter for
Qwen/Qwen3.5-397B-A17B fine-tuned on AMD GPU kernel engineering trajectories using
LLaMA-Factory.
Specializes Qwen3.5-397B-A17B for
AMD GPU kernel optimization tasks -- writing Triton kernels, debugging ROCm issues, and optimizing performance on AMD Instinct GPUs. Trained on 104 multi-turn agent trajectories from the
amdpilot dataset.
Eval loss decreases monotonically with no overfitting.
wandb run.
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4tokenizer = AutoTokenizer.from_pretrained("JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v3")
5model = AutoModelForCausalLM.from_pretrained(
6 "Qwen/Qwen3.5-397B-A17B", device_map="auto", torch_dtype="bfloat16"
7)
8model = PeftModel.from_pretrained(model, "JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v3")
1python -m vllm.entrypoints.openai.api_server \
2 --model Qwen/Qwen3.5-397B-A17B \
3 --enable-lora \
4 --lora-modules amdpilot=JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v3 \
5 --tensor-parallel-size 8
1llamafactory-cli export \
2 --model_name_or_path Qwen/Qwen3.5-397B-A17B \
3 --adapter_name_or_path JinnP/Qwen3.5-397B-A17B-LoRA-SFT-v3 \
4 --template qwen3_5_nothink \
5 --finetuning_type lora \
6 --export_dir saves/qwen35-397b-merged
JinnP/amdpilot-lora-sft-dataset -- 104 multi-turn agent trajectories: