image_folder = "PATH_TO_IMAGE_FOLDER"
metadata_file = os.path.join(image_folder, 'metadata.jsonl')
with open(metadata_file, 'r', encoding='utf-8') as f:
for line in f:
data = json.loads(line)
filename = data['file_name'].split('.')[0]
text = data['caption']
output_file = os.path.join(image_folder, f'{filename}.txt')
with… See the full description on the dataset page:
https://huggingface.co/datasets/terrificdm/hitoimim.