이 데이터셋은 KB금융그룹의 페르소나를 가진 금융 특화 소형 언어 모델(sLLM)을 개발하기 위해 제작된 3.1만 건 규모의 대화형 학습 데이터셋입니다.
Qwen/Qwen2.5-14B-Instruct 모델의 파인튜닝에 최적화되어 있으며, 다음과 같은 세 가지 핵심 요소의 균형을 맞춰 구성했습니다.
KB금융 특화 지식: KB금융그룹 내부 문서를 기반으로 생성된 Q&A
고품질 금융 상식: 신뢰도 높은 한국 금융 지시(Instruction) 데이터
자연스러운 일상 대화: 일반적인 질문에 대한 대응 및 모델 페르소나 형성을 위한 데이터
v3 주요 변경점: v2에서 사용했던 aiqwe/FinShibainu 데이터셋을, 더 높은 품질과 신뢰도를 가진 KRX-Data/Won-Instruct로 전면… See the full description on the dataset page:
https://huggingface.co/datasets/rucipheryn/combined-dataset-30K-final-v3.