Views
No views yet
add_generation_prompt=True (matches vLLM inference)add_generation_prompt=False during trainingadd_generation_prompt=True during inference1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base = "Qwen/Qwen3-4B-Instruct-2507"
6adapter = "astom-M/qwen3-4b-structured-output-lora-clean"
7
8tokenizer = AutoTokenizer.from_pretrained(base)
9model = AutoModelForCausalLM.from_pretrained(
10 base,
11 torch_dtype=torch.float16,
12 device_map="auto",
13 trust_remote_code=True,
14)
15model = PeftModel.from_pretrained(model, adapter)
16
17# For vLLM inference (recommended):
18# Use the standard inference notebook provided by competition organizers1# Prompt: system + user messages only
2prompt_text = tokenizer.apply_chat_template(
3 prompt_messages,
4 add_generation_prompt=True # ← KEY FIX
5)
6# Response: assistant content (raw structured data)
7# Labels: Mask prompt part, only learn response part1# Exactly matches training format
2tokenizer.apply_chat_template(
3 messages,
4 add_generation_prompt=True # ← Now aligned!
5)