globis-university/aozorabunko-cleanを元に作成。
入力した段落からその著者を推定するモデル開発用に作成したデータセット。
著者の作品を学習させるのではなく、著者の作風や文章の特徴を学習させたい。
trainとvalidationで同じ作品や段落は含まないようにしたい。文字が違うだけの作品も同じとみなす。
作者の特徴が出るようにするため、一定以上の長さの段落だけにする。
labelの偏りをなくす。
["宮本百合子","岸田国士","小川未明","野村胡堂","坂口安吾","芥川竜之介","牧野信一","豊島与志雄","寺田寅彦","太宰治", '夏目漱石','江戸川乱歩',"森鴎外", "中谷宇吉郎", '岡本綺堂','折口信夫', '泉鏡花','山本周五郎']
ラベルはこのリストのインデックス
作品名が同じもの(例:アグニの神(新字旧仮名)とアグニの神(新字新仮名))は一つだけにする。… See the full description on the dataset page:
https://huggingface.co/datasets/takahashi111/aozorabunko-author-classification.