ITA-Base è il primo dataset pubblicato dalla HuggingFace Italian Community: una raccolta di conversazioni in italiano multi-turno pensata per il fine-tuning e la valutazione di modelli linguistici in lingua italiana, con particolare attenzione a chat generica, generazione di codice e tool-calling.
Il dataset è composto da conversazioni multi-turno in formato ShareGPT-style, organizzate in quattro categorie: