Korean Legal Instruction Dataset (한국어 법률 지시학습 데이터셋)
데이터셋 개요
이 데이터셋은 대한민국 법률 도메인에 특화된 sLLM 지시학습(Instruction Tuning)용 데이터셋입니다.
AIHub에서 제공하는 16종의 법률 관련 데이터를 통합하여 현대 LLM 지시학습 포맷으로 가공하였습니다.
총 데이터 수: 약 233,000건
언어: 한국어
포맷: ChatML/Alpaca 호환 대화 형식
도메인: 법률 (민사, 형사, 행정, 지식재산권, 계약 등)
각 데이터 샘플은 다음과 같은 구조를 가집니다:
{
"id": "고유 식별자",
"category": "카테고리명",
"source": "원본 데이터 출처",
"system": "시스템 프롬프트",
"instruction": "사용자 질문/지시",
"output": "AI… See the full description on the dataset page:
https://huggingface.co/datasets/neuralfoundry-coder/korean-legal-instruction-sample.