This dataset contains 10,000 jokes sampled from the original reddit_jokes.json dataset (195K jokes).
Only the first 10,000 jokes were selected.
reddit_jokes.json (195K jokes)
Extracted subset: 10k_jokes.csv
Typical fields include:
title
body
score
created_at
(fields depend on original format)
Useful for:
Humor generation models
NLP experiments
LLM fine-tuning
Joke classification tasks