Kashmiri OCR Dataset
Dataset Description
This dataset contains 5,000 samples of Kashmiri text images for OCR training.
Total samples: 5,000
Image dimensions: 1024x128
DPI: 300
Format: PNG images with UTF-8 text annotations
from datasets import load_from_disk
dataset = load_from_disk('kashmiri_hf_dataset')
Source: CSV file with 46,542 Kashmiri sentences
Augmentation: Enabled
Generated on:… See the full description on the dataset page:
https://huggingface.co/datasets/Omarrran/kashmiri_sample_text_rocognition.