This dataset is a public, mission-aligned COSMOGONY training corpus for multimodal
space-physics representation learning. It is curated from public providers and
published as a materialized dataset for direct training.
Split: train
Rows: 4,249,403
Core modalities represented:
space_weather_timeseries
orbital_elements
planetary_system_catalog
Canonical columns:
record_id
modality (list of strings)
source
source_url… See the full description on the dataset page:
https://huggingface.co/datasets/cmgyai/cosmogony-multimodal-v3-scaled.