CPT (Continual Pre-Training) 数据集
数据集概述
本数据集用于 LLaMA-8B 模型的继续预训练(Continual Pre-Training, CPT),旨在让通用大模型适应医疗领域。数据集包含 200,000 条样本,按照 70% 通用语料 + 30% 医疗语料 的比例混合,覆盖中英文维基百科和医疗专业文本。
数据来源与处理
1. Wikipedia 英文 (wikimedia/wikipedia)
原始数据量: 6,407,814 条
采样数量: 70,000 条
来源: wikimedia/wikipedia (20231101.en)
处理方式:
加载 2023-11-01 版本的英文维基百科
仅保留 text 字段
随机采样 70,000 条(seed=42)
原始数据量: 1,384,748 条
采样数量:… See the full description on the dataset page:
https://huggingface.co/datasets/bootscoder/Medical-ChatBot-CPT.