1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_id = "Qwen/Qwen3.5-9B"
5adapter_id = "gyung/qwen35-9b-ko-legal-bar-hardcase-source-lora-20260621-v4"
6
7tokenizer = AutoTokenizer.from_pretrained(base_id, trust_remote_code=True)
8model = AutoModelForCausalLM.from_pretrained(
9 base_id,
10 device_map="auto",
11 torch_dtype="auto",
12 trust_remote_code=True,
13)
14model = PeftModel.from_pretrained(model, adapter_id)
1python -m vllm.entrypoints.openai.api_server \
2 --model Qwen/Qwen3.5-9B \
3 --enable-lora \
4 --lora-modules qwen35-9b-ko-legal-bar-hardcase-source-lora-20260621-v4=./qwen35-9b-ko-legal-bar-hardcase-source-lora-20260621-v4 \
5 --served-model-name qwen35-9b-ko-legal-bar-hardcase-source-lora-20260621-v4 \
6 --max-model-len 12288