Датасет содержит результат парсинга анекдотов, наскрапленных с разных сайтов.
Каждый сэмпл содержит четыре поля:
"context" - контекст диалога, включая все недиалоговые вставки. Обратите внимание, что контекст содержит как предшествующие реплики, так и прочий сопутствующий текст, так
как он определяет общий сеттинг, необходимый для генерации реплики. Из реплики удалены маркеры косвенной речи.
"utterance" - диалоговая реплика.
"hash" -… See the full description on the dataset page:
https://huggingface.co/datasets/inkoziev/jokes_dialogues.