GPT-OSS 120B 모델을 위한 QLoRA (Quantized Low-Rank Adaptation) 어댑터입니다. Unsloth 라이브러리를 사용하여 파인튜닝되었습니다.
1from unsloth import FastLanguageModel
2
3# 베이스 모델과 함께 어댑터 로드
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name="jiwon9703/gpt-oss-120b-qlora-4bit-v2",
6 max_seq_length=8192,
7 load_in_4bit=True,
8 device_map="auto",
9)
10
11# 추론 모드로 전환
12FastLanguageModel.for_inference(model)
1messages = [
2 {"role": "user", "content": "한국의 수도는 어디인가요?"}
3]
4
5# reasoning effort와 함께 채팅 템플릿 적용
6inputs = tokenizer.apply_chat_template(
7 messages,
8 add_generation_prompt=True,
9 return_tensors="pt",
10 return_dict=True,
11 reasoning_effort="medium", # "low", "medium", "high" 중 선택
12).to("cuda")
13
14# 응답 생성
15outputs = model.generate(
16 **inputs,
17 max_new_tokens=512,
18 temperature=0.7,
19 top_p=0.9,
20 do_sample=True,
21)
22
23response = tokenizer.decode(outputs[0], skip_special_tokens=True)
24print(response)
1# 높은 추론 강도 예시
2inputs = tokenizer.apply_chat_template(
3 messages,
4 add_generation_prompt=True,
5 return_tensors="pt",
6 return_dict=True,
7 reasoning_effort="high", # 더 철저한 추론
8).to("cuda")