Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
CUTE-Datasets – Dataset by CMLI-NLP | AlphaNeural AI
You can deploy this model and start earning money today!
CMLI-NLP
/
CUTE-Datasets
like
0
zh
ug
bo
en
cc-by-4.0
1M<n<10M
text
text
datasets
mlcroissant
us
Views
No views yet
Model card
Files and Versions
Community
API
CUTE Dataset
CUTE (Chinese, Uyghur, Tibetan, English) 是一个大规模多语言数据集,专门设计用于增强低资源语言的跨语言知识迁移。数据集包含平行语料和非平行语料两部分,总规模约50GB。
数据集组成 平行语料 (24.70GB)
中文:2.62GB 英语:3.49GB 维吾尔语:7.37GB 藏语:11.22GB
非平行语料 (25.80GB)
中文:2.64GB 英语:3.49GB 维吾尔语:7.77GB 藏语:11.90GB
数据质量
数据集通过机器翻译生成,并经过人工评估验证:
中英翻译平均得分:9.1 中维翻译平均得分:8.5 中藏翻译平均得分:8.6
使用说明 ⚠️ 平行语料重要提醒
关于句对级对齐:
四种语言的txt文件行数略有不同(如论文Table 2所示)… See the full description on the dataset page:
https://huggingface.co/datasets/CMLI-NLP/CUTE-Datasets
.