Dataset Card for KB-sLLM-QA-Dataset-Final-Split
Dataset Summary
이 데이터셋은 KB금융그룹의 페르소나를 가진 금융 도메인 특화 소형 언어 모델(sLLM) 개발을 위해 제작된 질의응답(Q&A) 데이터셋입니다.
KB금융그룹의 공개된 233개의 PDF 문서를 기반으로, OpenAI의 GPT-4o-mini 모델을 활용하여 1,157개의 Q&A 쌍을 생성했습니다.
각 질문은 금융 고객이나 내부 직원이 가질 법한 구체적인 질문으로 구성되었으며, 답변은 오직 제공된 PDF 문서 내용에만 근거하여 생성되었습니다.
이 데이터셋은 모델이 KB금융그룹에 특화된 지식을 얼마나 잘 학습했는지 객관적으로 평가하기 위한 테스트셋(test set)을 포함하고 있습니다.
총 데이터 수: 1,157
학습용 (Train): 1,007
평가용 (Test): 150
언어: 한국어 (Korean)
How… See the full description on the dataset page: https://huggingface.co/datasets/rucipheryn/KB-sLLM-QA-Dataset-Final-Split.