ParsynthOCR is a synthetic dataset for Persian OCR. This version is a preview of the original 4 million samples dataset (ParsynthOCR-4M).
from datasets import load_dataset
dataset = load_dataset("hezarai/parsynth-ocr-200k")
pip install hezar
from hezar.data import Dataset
dataset = Dataset.load("hezarai/parsynth-ocr-200k", split="train")