heegyu/namuwiki-extracted을 기반으로 작성되었습니다.
전체 565k개 문서 중, Qwen3-30B-A3B 모델을 이용하여 한국 역사/문화/제도 관련 내용이 포함된 문서 약 55k개 식별 및 내용 요약..(1)
Gemini-2.5-flash 모델을 이용하여 선다형(객관식, 5지선다), 단답형 문제 생성..(2)
(2)에서 생성된 문제 중, DeepSeek-V3-0324가 정답을 맞춘 문제만 추출
(1)을 바탕으로 서술형 문제(XXX에 대해 자세히 알려주세요.)를 생성하여 선다형, 단답형 문제와 통합
선다형/단답형 문제의 원본 문서
각 문제의 id 첫번째 숫자를 바탕으로, id가 "{id}_서술_01"인 질문을 확인(서술형 문제)
질문이 "XXX에 대해 자세히 알려주세요." 일 경우, XXX가 원본 나무위키 문서명
질문이… See the full description on the dataset page:
https://huggingface.co/datasets/werty1248/K-Namu-Full-Trainset.