iamjoon/klue-mrc-ko-rag-dataset을 활용해 답변을 생성하는 과정을 CoT로 보강한 데이터셋입니다.
검색된 문서 수가 3개인 경우와 5개인 경우를 나눠서 데이터셋을 구성하였습니다.
question: 사용자의 질문
search_result: 검색 결과
최소 1개~최대 5개까지 다양하게 구성.
answer: 사용자의 질문과 검색 결과를 바탕으로 답변합니다.
extracted_ref_numbers: 검색 결과 중 실제 정답으로 사용된 문서의 번호
최소 0개~최대 5개까지 다양하게 구성.
llm_result : 위 데이터를 활용해 LLM으로 생성한 답변.
구체적으로는 질문에 대해 검색된 문서들을 참고해 적절한 답변을 'answer' 블록에 생성하고, 그 과정을 추론하게 한 결과를 'reasoning' 블록에 작성, 최종적으로 답변 생성에 참고한 문서의 번호를 'doc_num'에 작성하도록… See the full description on the dataset page:
https://huggingface.co/datasets/didi0di/klue-mrc-ko-rag-cot.