Dự án này thực hiện tóm tắt văn bản tiếng Việt theo hướng extractive — chọn ra những câu quan trọng từ bản gốc để tạo bản tóm tắt — bằng cách fine-tune mô hình PhoBERT.
Dữ liệu thu thập từ 67 chuyên mục trên vnexpress.net.
Một phần dữ liệu được gán nhãn thủ công.
Phần lớn dữ liệu được gán nhãn tự động bằng phương pháp cosine similarity.