🇻🇳 Tóm tắt. Bộ dữ liệu đa cấp của các bản án + án lệ
Việt Nam thu thập từ cổng anle.toaan.gov.vn
của Tòa án nhân dân tối cao. Mỗi văn bản pháp lý đi kèm markdown
đã chuẩn hoá tiếng Việt (NFC + chính tả hiện đại) và lớp cấu trúc
phân cấp đầy đủ: document → section → paragraph → sentence.
Bộ dữ liệu ship bốn cấu hình HF tương ứng bốn giai đoạn pipeline:
documents (mặc định) · sentences (mức câu) · embed (vector
4096-D) · reduce (PCA /… See the full description on the dataset page:
https://huggingface.co/datasets/tmquan/anle-toaan-gov-vn.