This repository contains Image-Text-Point Cloud triplets specifically curated for the Contrastive Tensor Pre-training (CTP) framework. By aligning 2D visual semantics, 3D LiDAR geometries, and natural language descriptions, this dataset supports research in unified multimodal representation learning.