DataViz-99 is a fine-tuned LLM adapter for natural language to visualization (NL2VIS) tasks. Given a database schema and a natural language request, the model outputs a structured chart specification in closed-label format.
Base Model: Llama-3.3-70B-Instruct
Fine-tuning Method: LoRA via Adaption AutoScientist
Task: NL2VIS (Natural Language to Visualization)
Category: Data Visualization (AutoScientist Challenge 2026)
Training Data
Source
nvBench: 7,247 real visualization entries from TsinghuaDatabaseGroup
Spider: 166 real SQL database schemas from Yale LILY
Chart types: bar, line, pie, scatter, histogram, heatmap, area, boxplot
Aggregates: SUM, COUNT, AVG, MIN, MAX, NONE
COUNT(*) Normalization
Fixed 60.1% of examples where COUNT(column) vs COUNT(*) renders identical charts
Following Fernandosr85's methodology for 98% baseline
Schema-Grounded Generation
Column names must match exactly from Spider database schemas
Invalid columns trigger REFUSE response
Hard Negatives for Robust Moat
Non-existent column → REFUSE
Invalid chart type → REFUSE
Ambiguous request → CLARIFY
Off-topic request → REFUSE
Intended Use
Primary Use Case
Convert natural language visualization requests into structured chart specifications for business intelligence, data analysis, and reporting applications.
Example
Input:
Schema:
Table: sales
Columns: date, product_id, revenue, quantity, region
Request: Show total revenue by region
Schema Required: Requires explicit schema in prompt; cannot infer from context
Single Chart: Outputs one chart specification per request; no multi-chart dashboards
Training Configuration
Adaption AutoScientist Settings
Setting
Value
Enhanced Completions
OFF
Prompt Rephrase
OFF
Hallucination Mitigation
OFF
Expansion
Minimum
Rationale: Closed-label tasks require original completions only. Enhanced/Rephrase can invent labels outside the fixed taxonomy.
Training Hyperparameters
Method: LoRA (Low-Rank Adaptation)
Epochs: 4
Base Model: Llama-3.3-70B-Instruct
Ethical Considerations
No PII: Training data contains synthetic queries and public benchmark schemas only
No Bias Amplification: Chart type selection is deterministic based on query semantics
Transparent Failures: Model outputs REFUSE/CLARIFY rather than hallucinating invalid specifications
Citation
nvBench
bibtex
1@inproceedings{nvbench2021,
2 title={nvBench: A Large-Scale Synthesized Dataset for Cross-Domain Natural Language to Visualization Task},
3 author={Luo, Yuyu and Tang, Nan and Li, Guoliang and others},
4 booktitle={SIGMOD},
5 year={2021}
6}
Spider
bibtex
1@inproceedings{spider2018,
2 title={Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task},
3 author={Yu, Tao and others},
4 booktitle={EMNLP},
5 year={2018}
6}
Model Card Authors
Ankit Pandey (@pandeyankit99)
Fine-tuned via Adaption Labs AutoScientist
License
CC-BY-4.0
Submission for AutoScientist Challenge 2026 - Data Visualization CategoryPowered by Adaptive Data + AutoScientist by Adaption Labs