Qwen3-4B-ADELIE-DPO는 정보 추출(Information Extraction)에 최적화된 LoRA 어댑터입니다.
ADELIE(Adaptive Domain-Expert Learning for Information Extraction) 프레임워크를 기반으로
DPO(Direct Preference Optimization) 방식의 preference alignment 학습을 적용했습니다.
목표는 복잡한 IE 환경에서 정교하고 안정적인 추출 성능 향상입니다.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_model = AutoModelForCausalLM.from_pretrained(
6 "Qwen/Qwen3-4B-Instruct-2507",
7 torch_dtype=torch.bfloat16,
8 device_map="auto"
9)
10
11model = PeftModel.from_pretrained(
12 base_model,
13 "tungtungsahuru/Qwen3-4B-ADELIE-DPO"
14)
15
16tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-4B-Instruct-2507")
17
18messages = [{"role": "user", "content": "Your prompt here"}]
19text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
20inputs = tokenizer([text], return_tensors="pt").to(model.device)
21
22outputs = model.generate(
23 **inputs,
24 max_new_tokens=512,
25 do_sample=True,
26 temperature=0.7,
27 top_p=0.95
28)
29
30print(tokenizer.decode(outputs[0], skip_special_tokens=True))
1model = model.merge_and_unload()
2model.save_pretrained("./merged_model")
3tokenizer.save_pretrained("./merged_model")
generation_config = {
"max_new_tokens": 512,
"do_sample": True,
"temperature": 0.7,
"top_p": 0.95,
"repetition_penalty": 1.1
}
1@article{bai2023qwen,
2 title = {Qwen Technical Report},
3 author = {Bai, Jinze and others},
4 year = {2023},
5 note = {Preprint}
6}
7
8@inproceedings{qi2024adelie,
9 title = {ADELIE: Aligning Large Language Models on Information Extraction},
10 author = {Qi, Yunjia and Peng, Hao and Wang, Xiaozhi and Xu, Bin and Hou, Lei and Li, Juanzi},
11 booktitle = {Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024)},
12 pages = {7371--7387},
13 year = {2024},
14 doi = {10.18653/v1/2024.emnlp-main.419}
15}
16
문의 사항은 Hugging Face Issues 탭을 통해 남겨주세요.