Um volume significativo do conhecimento acadêmico global, particularmente a literatura cinza como teses e dissertações, é sistematicamente excluído dos conjuntos de dados que alimentam a IA moderna e a ciência da ciência. Essa omissão introduz vieses linguísticos e culturais profundos, resultando em uma compreensão distorcida da produção científica global. Para preencher essa lacuna crítica, apresentamos o PHAENIX-1, um conjunto de dados em… See the full description on the dataset page:
https://huggingface.co/datasets/Larxel/PHAENIX-1.