nanochat の日本語フォーク nanochat-jp で使用する SFT(教師ありファインチューニング)用日本語データ です.
公開されている日本語指示データと,ペルソナ条件付きで生成した日本語マルチターン対話(self-chat)を,nanochat の SFT データローダがそのまま読める JSONL 形式で配布しています.
1行が1会話で,各行は messages の JSON 配列です.user から始まり assistant で終わる交互の並びになっています.
[{"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]
v1/ 以下のファイル群を $NANOCHAT_BASE_DIR/datasets/nanochat-jp-sft/v1/ に配置すると,nanochat-jp の scripts/chat_sft.py… See the full description on the dataset page:
https://huggingface.co/datasets/tohoku-nlp/nanochat-jp-sft.