These are the tags of the danbooru 2021 + danbooru 2022 dataset.
The dataset is deduplicated by post id, and if there is no post id, the value is sequentially set to -{value}.
load dataset
from datasets import load_dataset
dataset = load_dataset('qwopqwop/danbooru2022_tags')
preprocess code
import os
import glob
import json
import pandas as pd
import concurrent.futures
dataset = {}
ids = {}
#danbooru 2021#download 'rsync --recursive --verbose rsync://176.9.41.242:873/danbooru2021/metadata/… See the full description on the dataset page:
https://huggingface.co/datasets/qwopqwop/danbooru2022_tags.