Dataset de entrevistas de Heller en formato ChatML multi-turn, diseñado para fine-tuning de LLMs.
📋 Descripción
Fuente: Entrevistas de YouTube (canales de noticias y política argentina)
Procesamiento: Audio → Whisper (transcripción) → PyAnnote/SpeechBrain (diarización) → ChatML
Formato: Conversaciones multi-turn con roles system, user (entrevistador), assistant (Heller)
Idioma: Español rioplatense argentino
📊 Estadísticas… See the full description on the dataset page: https://huggingface.co/datasets/orlandoju/heller-gpt-dataset.