このデータセットは、以下の分割(split)ごとに整理された処理済みデータを含みます。
strategyqa: 1 JSON files, 1 Parquet files
medcal: 1 JSON files, 1 Parquet files
各 split は JSON 形式と Parquet 形式の両方で利用可能です:
JSONファイル: 各 split 用サブフォルダ内の元データ(medcal/)
Parquetファイル: split名をプレフィックスとした最適化データ(data/medcal_*.parquet)
各 JSON ファイルには、同名の split プレフィックス付き Parquet ファイルが対応しており、大規模データセットの効率的な処理が可能です。
from datasets import load_dataset
特定の split を読み込む
strategyqa_data =… See the full description on the dataset page:
https://huggingface.co/datasets/neko-llm/cot_general.