This dataset contains 10 diverse failure cases identified while testing the Qwen3-VL-2B-Instruct vision-language model. Each example captures a specific type of error, providing valuable insights for targeted fine-tuning.
Failure Category
Count
Examples
Time Reading
2
Clock misreading (11:55 vs 10:10; 3:35 vs 10:35)
Counting
2
Remote buttons (3 vs 0); Strawberries (4 vs 1)