Views
No views yet
| 항목 | 내용 |
|---|---|
| Base Model | Qwen/Qwen3-14B |
| Teacher Model | DeepSeek-v3.2 (OpenRouter API) |
| 양자화 방식 | GPTQ 4-bit |
| 파라미터 수 | 14.8B |
| 학습 언어 | 한국어 (주), 영어 |
| 학습 데이터 | 2,031건 한국어 학술 지문 (CoT 포함) |
<think> 태그 포함 사고 과정 생성</think> 포함 보장)⚠️ 14B 모델은 양자화 후에도 +2.8% 성능 향상이 유지되었습니다.
(32B 이상 대형 모델에서는 과적합으로 인한 양자화 성능 저하 패턴이 확인됩니다.)
| 지표 | 결과 |
|---|---|
| 기본 모델 대비 성능 변화 | +2.8% |
| 정답 추출 성공률 | 100% |
| 데이터 커버리지 | 100% (2,031건) |
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("xeker/qwen3-14b-distilled-gptq")
4model = AutoModelForCausalLM.from_pretrained(
5 "xeker/qwen3-14b-distilled-gptq",
6 device_map="auto"
7)
8
9messages = [
10 {"role": "system", "content": "당신은 한국어 학술 지문을 분석하고 추론하는 전문가입니다."},
11 {"role": "user", "content": "다음 지문을 읽고 질문에 답하세요.\n\n[지문 내용]"}
12]
13
14text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
15text += "<think>\n" # Prompt Pre-filling: CoT 추론 강제
16
17inputs = tokenizer(text, return_tensors="pt").to(model.device)
18outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.7)
19print(tokenizer.decode(outputs[0], skip_special_tokens=False))Prompt Pre-filling (<think>\n)을 사용하면 모델이 Tool Call 없이 Chain-of-Thought 추론을 수행합니다.
Python PyTorch Transformers vLLM GPTQ Knowledge Distillation OpenRouter API