The first aligned Ukrainian–English idiom corpus — 2,262 clusters with
idiom strings, translations, contextual example sentences, and figurative
meanings on both language sides.
Companion to the paper "SimIdioms: A Corpus and Benchmark for Ukrainian
Idiom Translation" (UNLP 2026). Code and evaluation framework:
github.com/petrunivyaryna/sim-idioms.
from datasets import load_dataset
ds = load_dataset("KSE-RESEARCH-Group/sim-idioms", split="train")… See the full description on the dataset page:
https://huggingface.co/datasets/KSE-RESEARCH-Group/sim-idioms.