CAMS (Chinese Attribute-based Multi-faceted Summarization) 是一个为推进长文本摘要研究而设计的大规模中文摘要数据集。随着大型语言模型(LLMs)的快速发展,高质量、大规模的训练数据变得至关重要,特别是在非英语语种中。CAMS 旨在填补中文长文本摘要领域的空白。
数据集包含 100万篇 高质量的中文长文章,每篇文章都配有三个不同粒度的摘要和一组丰富的属性标签。
专注长文本: 数据集中的文章平均长度超过 1500 个字符,为长文本摘要模型提供了富有挑战性的训练和评估平台。
多层次摘要: 每篇文章都提供三个层级结构的摘要:
长摘要 (Long Summary): 详细、全面地覆盖原文的关键信息。
中摘要 (Medium Summary): 简洁地概括文章的核心要点。
短摘要 (Short Summary):… See the full description on the dataset page:
https://huggingface.co/datasets/Mxode/CAMS.