VnExpress News Multi-label Dataset 2025
Giới thiệu
Bộ dữ liệu ~18,500 bài báo từ VnExpress.net, được gán nhãn đa nhãn với 88 chủ đề.
Phù hợp cho bài toán phân loại văn bản tiếng Việt (Vietnamese text classification).
Thống kê
Train: 14,860 bài
Test: 3,715 bài
Số nhãn: 88
Ngôn ngữ: Tiếng Việt
Tiền xử lý
Word segmentation: underthesea
Stopwords removal
One-hot encoding nhãn