This is a carefully crafted dataset for topic labeling. It maps a series of words (generated by topic models like LDA, Top2Vec etc.) to a topic label so that LLMs like T5, Mistral etc. can be fine-tuned on this dataset to generate topic labels for a given text. Parts of this dataset have been labeled manually or using GPT-4.
Source datasets:
wikimedia/wikipedia
textminr/mn-ds
Additional sources:
Project Gutenberg