The fine-tuned model demonstrates improvements in:
• Domain knowledge (accurate recognition of Lithuanian public transport vehicles, route numbers, and common
street signs)
• Naturalness and grammatical correctness of Lithuanian text
• Focus on task-relevant elements instead of generic image descriptions