Unlike general-purpose models, DriveFusionQA is specifically optimized to answer the "why" behind driving maneuvers, making it an essential tool for safety analysis, simulation, and interactive driving support.
DriveFusionQA demonstrates significant improvements over the base model across all key driving-related language metrics. The substantial increase in Lingo-Judge scores reflects its superior ability to generate human-aligned driving reasoning.
The model was trained using the
DriveFusion Data Preprocessing pipeline, which standardizes diverse autonomous driving datasets into a unified format.
1from transformers import Qwen2_5_VLForConditionalGeneration, AutoProcessor
2from PIL import Image
3import torch
4
5model_id = "DriveFusion/DriveFusionQA"
6model = Qwen2_5_VLForConditionalGeneration.from_pretrained(
7 model_id, torch_dtype="auto", device_map="auto"
8)
9processor = AutoProcessor.from_pretrained(model_id)
10
11# Load driving scene
12image = Image.open("driving_sample.jpg")
13messages = [
14 {
15 "role": "user",
16 "content": [
17 {"type": "image", "image": image},
18 {"type": "text", "text": "Describe the current driving scenario and any potential risks."},
19 ],
20 }
21]
22
23# Generate Response
24text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
25inputs = processor(text=[text], images=[image], return_tensors="pt").to("cuda")
26
27output_ids = model.generate(**inputs, max_new_tokens=256)
28response = processor.batch_decode(output_ids, skip_special_tokens=True)
29print(response[0])
1@misc{drivefusionqa2026,
2 title={DriveFusionQA: A Vision Language Language Model for Autonomous Driving},
3 author={Samir, Omar and DriveFusion Team},
4 year={2026},
5 url={https://huggingface.co/DriveFusion/DriveFusionQA}
6}