LLaVa 1.5 eğitim çerçevesi ve Trendyol Mistral v1.0 Chat modeli kullanılarak eğitilmiş bir büyük görüntü dil modelidir. VQA, image captioning, OCR, visual grounding ve visual reasoning görevleri için eğitilmiştir. Not:OCR ve object detection görevlerinde başarı yüksek değil.
Prompt Şablonları
1)Lütfen bu bölge için kısa bir açıklama yapınız: [x1, y1, x2, y2].
-Lütfen bu bölge için kısa bir açıklama yapınız: [0. 62, 0. 65, 0. 66, 0. 8].
-BBox koordinatları 0-1 aralığında x1,y1,x2,y2 koordinatlarını temsil ediyor. Resmin sol üst köşesi (0,0).
2)Lütfen bu cümlenin tanımladığı bölgenin sınırlayıcı kutu koordinatını sağlayın: {cümle}.
-Lütfen bu cümlenin tanımladığı bölgenin sınırlayıcı kutu koordinatını sağlayın: plajda duran kişi.
3)Verilen resmin öğeleri hakkında ayrıntılı bilgi verebilir misiniz?
4)Verilen görsel için tek cümlelik bir başlık girin.
5)Resmin görsel içeriğini çok ayrıntılı olarak açıklayın.
6){soru}?\nA. {seçenek}\nB. {seçenek}\nC. {seçenek}\nD. {seçenek}\nVerilen seçeneklerden doğru olanıyla cevap verin.
-Lambanın üzerinde ne tür bir abajur var?\nA. temiz cam\nB. saçak\nC. kumaş\nD. tiffany tarzı\nVerilen seçeneklerden doğru olanıyla cevap verin.