A curated dataset of furniture images in four categories, with detailed attribute annotations.
Designed for training and evaluating small Vision Language Models (VLMs) in extracting structured information from furniture images.
Dataset Description
Overview
Total Images: 10,000
Training Set: 9,000 images (generated)
Test Set: 1,000 images (real photographs)
Image Generation: Stable Diffusion Medium 3.5
Test Set Annotation: Qwen2 VL… See the full description on the dataset page: https://huggingface.co/datasets/filnow/furniture-synthetic-dataset.