This dataset is used by me using wiki data to get all characters in English and Vietnamese pages in the following list of categories:
Q5 : human
Q95074 : fictional_character
Q15632617 : fictional_human
Q15773347 : television_character
Q1114461 : comic_book_character
Q4271324 : literary_character
Then I use wikipedia-api to get the content of each page characters