한국어 시설물 안전점검·정밀안전진단 보고서의 의미 검토를 위한 실험용 모델입니다. 공개 v1(Qwen3.8-27B-Inspect-v01)의 후속 학습 모델이며, 기본 추론 설정은 enable_thinking=True, reasoning_effort="medium"입니다.
시설물 평가는 학습 자료와 정확 중복이 없는 합성 사례 50건을 thinking-on, greedy decoding으로 실행했습니다. AIME는 도메인 파인튜닝 후 일반 추론 성능이 유지되는지 확인하기 위한 지표입니다.
v2의 시설물 판정 정확도는 v1보다 10.0%p 높았고, 50건 모두 정상적인 thinking 종료와 엄격 JSON 스키마를 충족했습니다.
AIME 정확도는 원본 Base 47/60 (78.3%), v1 46/60 (76.7%), v2 49/60 (81.7%)이었습니다. 이번 평가에서는 시설물 도메인 파인튜닝 이후에도 일반 추론 성능이 크게 저하되지 않았습니다. 다만 60문항의 단일 greedy pass 결과이므로 성능 향상보다는 성능 보존 지표로 해석해야 합니다.
Qwen3.5 아키텍처를 지원하는 Transformers 버전을 사용하십시오. 이 체크포인트는 Transformers 5.14.1/5.15.0과 vLLM 0.17.1에서 검증했습니다.
1import torch
2from transformers import AutoModelForImageTextToText, AutoProcessor
3
4model_id = "nowdoor/Qwen3.8-27B-Inspect-v2"
5processor = AutoProcessor.from_pretrained(model_id)
6model = AutoModelForImageTextToText.from_pretrained(
7 model_id,
8 dtype=torch.bfloat16,
9 device_map="auto",
10)
11
12messages = [
13 {
14 "role": "system",
15 "content": (
16 "너는 시설물 안전점검·정밀안전진단 보고서를 지침에 따라 "
17 "의미 중심으로 검토하는 전문가다. 입력에 없는 사실은 추정하지 않는다."
18 ),
19 },
20 {
21 "role": "user",
22 "content": "보고서 발췌와 검토 기준을 여기에 입력합니다.",
23 },
24]
25prompt = processor.apply_chat_template(
26 messages,
27 tokenize=False,
28 add_generation_prompt=True,
29 enable_thinking=True,
30 reasoning_effort="medium",
31)
32inputs = processor(text=prompt, return_tensors="pt").to(model.device)
33
34with torch.inference_mode():
35 output = model.generate(**inputs, max_new_tokens=4096, do_sample=False)
36
37new_tokens = output[:, inputs["input_ids"].shape[1]:]
38print(processor.batch_decode(new_tokens, skip_special_tokens=True)[0])
BF16 가중치는 약 55.6GB입니다.
시설물 안전등급, 법적 적합성 또는 현장 기술자의 최종 판단을 대체하지 않습니다.
학습·평가 원문과 실행 로그는 이 저장소에서 배포하지 않습니다.
Apache License 2.0. 원본 모델의 라이선스와 사용 조건도 함께 확인하십시오.