TV2EN: Tuvaluan-English Parallel Corpus
Dataset Summary
Cleaned Tuvaluan-English parallel corpus
Dataset Details
Data Fields
tvl (string): Text in Tuvaluan
en (string): Text in English
domain (string): Source domain (bible, book/article, daily_text)
content_type (string): Content type (bible_verse, article_paragraph, daily_text)
doc_id (string, optional): Document identifier from JW.org
date (string, optional): Date for daily texts (YYYY-MM-DD… See the full description on the dataset page: https://huggingface.co/datasets/FriezaForce/tv2en-cleaned.