Views
No views yet
Scampolonii/vit-apartment-roomsopenai/clip-vit-large-patch14)keremberke/indoor-scene-classification (MIT Indoor Scenes, repackaged by Roboflow)bathroom, bedroom, children's room, corridor, dining room, kitchen, living room, nurserygoogle/vit-base-patch16-224| Epoch | Steps | Train Loss | Test Accuracy |
|---|---|---|---|
| 5 | 305 | 0.3851 | 0.9016 |
Per-epoch metrics were not logged (report_to="none"). Final test accuracy: 90.16% on the held-out test set.
evaluate library| Image | True Class | ViT Top-3 (score) | CLIP Top-3 (score) | GPT-4o (label, confidence) |
|---|---|---|---|---|
bathroom.jpg | bathroom | corridor (0.77)living room (0.10)kitchen (0.05) | corridor (0.93)bathroom (0.04)bedroom (0.01) | bathroom (0.85) |
bedroom.jpg | bedroom | living room (0.51)nursery (0.13)children's room (0.09) | bedroom (0.90)children's room (0.02)living room (0.01) | bedroom (0.90) |
kitchen.jpg | kitchen | living room (0.26)children's room (0.23)corridor (0.14) | kitchen (0.95)dining room (0.04)living room (0.01) | kitchen (0.90) |
living_room.jpg | living room | dining room (0.51)living room (0.24)children's room (0.11) | children's room (0.61)nursery (0.13)living room (0.11) | living room (0.90) |
corridor.jpg | corridor | corridor (0.92)living room (0.05)dining room (0.02) | corridor (0.96)nursery (0.02)dining room (0.01) | corridor (0.90) |
dining_room.jpg | dining room | dining room (0.45)living room (0.30)children's room (0.12) | dining room (0.85)living room (0.07)kitchen (0.05) | dining room (0.88) |
childrens_room.jpg | children's room | living room (0.38)children's room (0.23)dining room (0.21) | children's room (0.57)nursery (0.40)dining room (0.01) | children's room (0.90) |
nursery.jpg | nursery | nursery (0.79)children's room (0.16)living room (0.03) | nursery (0.87)children's room (0.00)bedroom (0.00) | nursery (0.95) |
| Model | Type | Top-1 Correct (8 samples) | Notes |
|---|---|---|---|
| Fine-tuned ViT | Transfer learning (fine-tuned) | 4/8 (50%) | Struggles with artistic/painting images |
| CLIP zero-shot | Open-source zero-shot | 6/8 (75%) | Strong generalization without fine-tuning |
| GPT-4o | Closed-source LLM vision | 8/8 (100%) | Best results, understands context |