The first multimodal Vision-Language Model specialized for quantum computing with Qiskit
Model Description
This model is a fine-tuned version of Qwen3-VL-8B-Instruct specialized for quantum computing tasks using Qiskit 2.0. This model can interpret visual representations of quantum computing: circuit diagrams, Bloch spheres, and measurement histograms.
The model was trained using vanilla LoRA (without rank stabilization) with rank 8 for 1 epoch on the Quantum Assistant Dataset. This model was part of the Phase 1 PEFT comparison experiments and was not evaluated on external benchmarks.
Key Capabilities
Code Generation: Generate complete Qiskit code from natural language descriptions
Function Completion: Complete function bodies from signatures and docstrings
Visual Understanding: Interpret quantum circuit diagrams, Bloch spheres, and histograms
Conceptual Explanations: Answer questions about quantum computing theory
Qiskit 2.0 Compliant: Uses modern APIs (SamplerV2, EstimatorV2, generate_preset_pass_manager)
Training Evaluation
This model was part of the Phase 1 PEFT variant comparison experiments. It was not evaluated on external benchmarks (Qiskit HumanEval, Qiskit HumanEval Hard, or synthetic test set).
Internal Validation Metrics
Metric
Value
Step
Eval Loss
0.646
183 (final)
Eval Token Accuracy
0.812
183 (final)
Train Loss
0.628
183 (final)
Train Token Accuracy
0.823
183 (final)
Training Runtime
1,056 seconds (~17.6 min)
1 epoch
PEFT Comparison Analysis
Vanilla LoRA performed worse than rsLoRA (Eval Loss 0.646 vs 0.622) in the Phase 1 experiments:
The lack of rank stabilization (α/√r scaling) led to slower convergence
Final validation loss was 3.9% higher than rsLoRA
Training time was similar (~1,056s vs 1,060s for rsLoRA)
PEFT Comparison
Comparison of PEFT variants: (a) validation loss, (b) token accuracy, (c) training time
Conclusion: rsLoRA's rank stabilization provides measurably better performance without additional computational cost, making vanilla LoRA suboptimal for this task.
Training Strategy
The experimental strategy was organized in two phases: PEFT technique selection and hyperparameter optimization.
Phase 1: PEFT Variant Comparison
Five LoRA variants were compared with controlled configuration (r=16, α=32, 1 epoch):
Variant
Eval Loss ↓
Eval Accuracy ↑
Runtime (s)
rsLoRA
0.622
0.818
1,060
DoRA
0.622
0.818
2,307
rsLoRA (frozen aligner)
0.623
0.817
1,057
LoRA (vanilla)
0.646
0.812
1,056
PiSSA
0.657
0.812
1,172
OLoRA
0.742
0.794
1,067
PEFT Comparison
Comparison of PEFT variants: (a) validation loss, (b) token accuracy, (c) training time
Key findings:
rsLoRA and DoRA achieved equivalent performance (Eval Loss 0.622)
DoRA has 2.18× computational overhead (2,307s vs 1,060s) due to magnitude-direction decomposition
rsLoRA selected for optimal performance-efficiency trade-off
PEFT Training Curves
Convergence curves of validation loss for PEFT variants
Phase 2: Rank and Epoch Optimization
With rsLoRA selected, the impact of adapter rank and training duration was investigated:
1from transformers import Qwen3VLForConditionalGeneration, AutoProcessor
2from qwen_vl_utils import process_vision_info
34model = Qwen3VLForConditionalGeneration.from_pretrained(5"samuellimabraz/Qwen3-VL-8B-lora",6 torch_dtype="auto",7 device_map="auto"8)9processor = AutoProcessor.from_pretrained("samuellimabraz/Qwen3-VL-8B-lora")1011messages =[12{"role":"system","content":"You are a quantum computing expert assistant specializing in Qiskit."},13{"role":"user","content":"Create a function that builds a 3-qubit GHZ state and returns the circuit."}14]1516messages_with_image =[17{"role":"system","content":"You are a quantum computing expert assistant specializing in Qiskit."},18{"role":"user","content":[19{"type":"image","image":"path/to/circuit.png"},20{"type":"text","text":"Implement the quantum circuit shown in the image."}21]}22]2324text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)25image_inputs, video_inputs = process_vision_info(messages)26inputs = processor(27 text=[text],28 images=image_inputs,29 videos=video_inputs,30 padding=True,31 return_tensors="pt"32).to(model.device)3334generated_ids = model.generate(**inputs, max_new_tokens=1024)35output = processor.batch_decode(36 generated_ids[:, inputs.input_ids.shape[1]:],37 skip_special_tokens=True38)[0]39print(output)
You are a quantum computing expert assistant specializing in Qiskit.
Provide accurate, clear, and well-structured responses about quantum computing concepts,
algorithms, and code implementation. Use Qiskit 2.0 best practices.
Intended Uses & Limitations
Intended Uses
Educational assistance: Learning quantum computing concepts with Qiskit
Code generation: Creating Qiskit circuits from descriptions or diagrams
Research prototyping: Rapid development of quantum algorithms
Limitations
Domain specificity: Optimized for Qiskit 2.0; may generate deprecated APIs for older versions
Dataset size: Trained on 5,837 samples; may underperform on rare edge cases
Category imbalance: Better performance on circuits_and_gates than primitives_and_execution
Hardware specifics: Limited coverage of IBM Quantum hardware-specific optimizations
Execution: Generated code requires verification before running on real quantum hardware
Bias and Risks
Model may perpetuate patterns from training data
Visual understanding limited to common diagram styles in Qiskit documentation
May generate syntactically correct but logically incorrect quantum algorithms
Should not be used for production quantum computing without human review
Citation
If you use this model in your research, please cite:
bibtex
1@article{braz2026quantumassistant,
2 title = {Quantum Assistant: Specialization of Multimodal Vision-Language Models for Quantum Computing},
3 author = {Braz, Samuel Lima and Leite, Jo{\~a}o Paulo Reus Rodrigues},
4 journal = {Expert Systems with Applications},
5 year = {2026},
6 issn = {0957-4174},
7 doi = {10.1016/j.eswa.2026.133931},
8 url = {https://doi.org/10.1016/j.eswa.2026.133931},
9 publisher = {Elsevier}
10}