target_langs = [
"German",
"Spanish",
"French",
"Italian",
"Korean",
"Dutch",
"Russian",
"English",
"Portuguese (Portugal)",
"Portuguese (Brazilian)",
"Spanish (Latin America)",
"Chinese (Simplified)",
"Chinese (Traditional)",
"Czech",
"Ukrainian",
"Hindi",
"Icelandic",
"Japanese",
"Polish",
"Swedish",
"Hungarian",
"Romanian",
"Danish",
"Norwegian (Nynorsk)",
"Norwegian (Bokmål)",
"Finnish"… See the full description on the dataset page:
https://huggingface.co/datasets/maxidl/nemotron-cc-10k-sample-translated-tower72-26langs.