A refined dataset of English word etymologies derived from Wiktionary entries via machine-readable JSONL from Kaikki.
Dataset Statistics
1. Data Pipeline & Volume
Original Source: 1,465,676 English entries (total lines in the Kaikki English JSONL).
Extracted Datapoints: 102,111 entries (words containing etymological templates parsed by wiktextract).