埋め込みモデルの学習、評価のためのクラスタリングデータセットです。
税関の事前教示回答(品目分類)から収集したデータを整形して作成しました。利用規約に基づき、データセットとして公開しております。
2024/6/23時点でダウンロードしたデータから、「一般的品名」が重複しているデータを削除しました。text列は「一般的品名」と「貨物概要」を結合したデータです。label列は、HSコードの「部」に該当します。部の情報は関税率表解説・分類例規のページの一覧表から取得しました。labelの割合を保ちつつ、ランダムにtrainとtestに分割しました。それぞれのsplitの件数は以下の通りです。
16
138
45… See the full description on the dataset page:
https://huggingface.co/datasets/oshizo/HSClustering-ja.