1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_id = "google/gemma-4-26b-a4b-it"
5adapter_id = "gyung/gemma4-26b-a4b-it-ko-legal-rag-top12-lora-smoke-20260620"
6
7tokenizer = AutoTokenizer.from_pretrained(base_id, trust_remote_code=True)
8model = AutoModelForCausalLM.from_pretrained(
9 base_id,
10 device_map="auto",
11 torch_dtype="auto",
12 trust_remote_code=True,
13)
14model = PeftModel.from_pretrained(model, adapter_id)
1python -m vllm.entrypoints.openai.api_server \
2 --model google/gemma-4-26b-a4b-it \
3 --enable-lora \
4 --lora-modules gemma4-26b-a4b-it-ko-legal-rag-top12-lora-smoke-20260620=./gemma4-26b-a4b-it-ko-legal-rag-top12-lora-smoke-20260620 \
5 --served-model-name gemma4-26b-a4b-it-ko-legal-rag-top12-lora-smoke-20260620 \
6 --max-model-len 12288