Views
No views yet
unsloth/Qwen3-4B-Instruct-2507 をベースモデルとし、QLoRAを用いてSFT + DPOでファインチューニングされた LoRA アダプターを提供します。daichira/structured-hard-sft-4kunsloth/Qwen3-4B-Instruct-2507u-10bei/dpo-dataset-qwen-cotoutputs/experiments/04_daichira_hard/04_daichira_hard/adapter1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base = "unsloth/Qwen3-4B-Instruct-2507"
6adapter = "kevineen/Qwen3-4B-instruct-2507-main-exp01"
7
8tokenizer = AutoTokenizer.from_pretrained(base)
9model = AutoModelForCausalLM.from_pretrained(
10 base,
11 torch_dtype=torch.float16,
12 device_map="auto",
13)
14model = PeftModel.from_pretrained(model, adapter)
15
16# 推論
17messages = [{"role": "user", "content": "Please output JSON code:\n\nTask: Generate a user profile with name and age."}]
18prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
19inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
20
21outputs = model.generate(**inputs, max_new_tokens=512, temperature=0.0)
22result = tokenizer.decode(outputs[0], skip_special_tokens=True)
23print(result)1vllm serve "kevineen/Qwen3-4B-instruct-2507-main-exp01" \
2 --base-model "unsloth/Qwen3-4B-Instruct-2507" \
3 --max-model-len 2048 \
4 --gpu-memory-utilization 0.60daichira/structured-hard-sft-4ku-10bei/dpo-dataset-qwen-cotunsloth/Qwen3-4B-Instruct-250704_daichira_harddpo_from_daichira_hardsft_dpo_v1daichira1@model{qwen3_4b_structeval_2026,
2 title={Qwen3-4B-Structured-Output-LoRA},
3 author={kevineen},
4 year={2026},
5 base_model={unsloth/Qwen3-4B-Instruct-2507},
6 sft_dataset={daichira/structured-hard-sft-4k},
7 dpo_dataset={u-10bei/dpo-dataset-qwen-cot},
8 license={CC-BY-4.0}
9}