RoViQA: Visual-Question-Answering model created by combining Roberta and ViT
This repository contains the code for
RoViQA, a Visual Question Answering (VQA) model that combines image features extracted using Vision Transformer (ViT) and text features extracted using RoBERTa. The project includes training, inference, and various utility scripts.
github: https://github.com/Tro-fish/RoViQA-Visual_Question_Answering