FT-LLM2026チューニングコンペティション (数学タスク) におけるチームdentakuの提出システム構築に利用したデータセットです。
本リポジトリでは第二段階SFTデータセットに利用したデータセットを公開しています。
各列名 (キー名) とその内容については以下の通りです
様々なデータソースからopenai/gpt-oss-120bを用いて合成されています。
生成したサンプル群に対してルールベース・LLMを用いたデータフィルタリングや重複排除,を複数回実施しました。
最終的に本データセットは5,741件の事例から構成されるデータセットとなりました。
データ構築方法の詳細はシステムレポートを参照してください。… See the full description on the dataset page:
https://huggingface.co/datasets/team-dentaku/dentaku-stage2.