mwparserfromhell 라이브러리를 활용하여 위키피디아 데이터를 열고 전처리하였습니다.
이때, parsing 과정에서 4000자 이상의 길이를 지니고 있으며 각주가 하나 이하만 존재하는 약 2천 개의 소규모 데이터만을 추출하였습니다.
LongAlign: A Recipe for Long Context Alignment of Large Language Models 논문의 Appendix에 제시된 네 가지 프롬프트를 활용하여 (Q, A) Instruction set을 생성하였습니다.
각 context마다 2개의 instruction set을 생성하였으며… See the full description on the dataset page:
https://huggingface.co/datasets/tryumanshow/longwiki-4k-ko.