Dữ liệu dịch vụ công, pháp luật và sách Tiếng Việt
📘 Tổng quan
Bộ dữ liệu tiếng Việt tổng hợp từ 3 nguồn chính nhằm phục vụ huấn luyện và tinh chỉnh mô hình ngôn ngữ lớn (LLM), đặc biệt cho các ứng dụng hành chính công và văn hóa tại Việt Nam.
🗂 Cấu trúc
Tập huấn luyện (train): 474,559 mẫu — ~2.48 GB
Tập kiểm tra (test): 52,729 mẫu — ~275 MB
Tổng dung lượng sau giải nén: ~2.57 GB
Định dạng: plain text (text field)