Preprocessing -- cleaning up messy characters, removing structure of Shakespeare (speaker names), removing empty lines, creating one collective dataset for both artists, adding metadata tags for each artists
Next Steps
Trying to train GPT-2 for better results instead of nanoGPT. Compute is expensive though.
Re-generate the dataset so that I get a heavier use of Shakespearean language. It leans more towards 21st century.