Большой русскоязычный пользовательский корпус с разговорной, форумной и неформальной лексикой.
Датасет полезен для экспериментов с моделями, которым нужно лучше понимать живой русский язык: разговорные формулировки, сленг, короткие реплики, бытовые темы и неоднородный пользовательский стиль.
pikabu_rudataset.parquet — крупный корпус пользовательских русскоязычных текстов в Parquet.
Ориентировочный размер:… See the full description on the dataset page:
https://huggingface.co/datasets/aiplatforms/Pikabushnik-RuDataset.