Dataset Summary
1.2.1) 한국어 QA 데이터셋의 질문으로 답변 자동 생성(ChatGPT): 12,000개
SFT 데이터: data/train
다음 단어만 잘 생성하는 모델에서 질문에 '잘' 대답하는 모델 만들기
Human labling이 필요하지만 ChatGPT 이용
질문을 입력으로 주고 ChatGPT로 답변 자동생성
데이터셋 예시
{
"prompt": "술 먹고 싶어",
"completion": "'술은 알코올이 함유된 음료수이며, 건강에 나쁜 영향을 미칠 수 있습니다. 따라서 술을 마시기 전에 본인의 건강 상태와 함께 적당한 양을 마시는 것이 중요합니다. 술을 마시기 전에 반드시 20세 이상인지 확인하시고, 규정된 양 이내에서 적절하게 즐기시길 바랍니다. 또한 술을 마시고 운전하는 것은 절대 금지하시기 바랍니다.",
"tokens": 189
}
1.2.2)… See the full description on the dataset page: https://huggingface.co/datasets/didi0di/KoChatGPT.