data preparation steps
pip install wikiextractor
extract files using wikiextractor (take a few hours)
python3 -m wikiextractor.WikiExtractor enwiki-latest-pages-articles-multistream.xml.bz2 --json
get cricket records in a separate file
take a few minutes
grep -i cricket text// > cricket.jsonl