What follows is research code. It is by no means optimized for speed, efficiency, or readability.
import os
import numpy as np
import pandas as pd
from sklearn.feature_extraction.text import TfidfTransformer
from sklearn.decomposition import TruncatedSVD
from tqdm.notebook import tqdm
from openTSNE import TSNE
import datashader as ds
import colorcet as cc
fromdask.distributed import Client
import dask.dataframe as dd
import dask_ml
import… See the full description on the dataset page:
https://huggingface.co/datasets/christopher/roots-tsne-data.