Vision-language-action (VLA) models have become a dominant paradigm for
generalist embodied agents, demonstrating strong complex and long-horizon task
completion in structured settings. Yet it remains an open question whether
current VLA systems can benefit from more effective architectural design, scale
to substantially larger and more heterogeneous data regimes, and achieve
broader generalization across tasks and embodiments. To this end, we present
GigaBrain-0.7, an embodied foundation model with substantially improved
generalization across diverse robot embodiments. Specifically, GigaBrain-0.7
unifies understanding, prediction, and action through a three-system
architecture, scales pretraining to over 37,000 hours of heterogeneous embodied
data, and introduces one-stage alignment training that jointly optimizes
vision-language understanding and multi-embodiment action generation. Compared
with the preceding GigaBrain-0 series and prior state-of-the-art models including
π0.5, GigaBrain-0.7 achieves substantial improvements in foundation
zero-shot capabilities, language-conditioned instruction following, and
post-training task success rates. In particular, on our in-house Maker H01
platform and mainstream robot embodiments, GigaBrain-0.7 demonstrates strong
task adaptability and completion ability across both home and industrial
scenarios.
1@article{gigabrainteam2026gigabrain07,
2 title={GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent
3 Capabilities with a Three-System Architecture},
4 author={GigaBrain Team and others},
5 journal={arXiv preprint arXiv:2608.15875},
6 year={2026},
7 eprint={2608.15875},
8 archivePrefix={arXiv},
9 primaryClass={cs.RO},
10 url={https://arxiv.org/abs/2608.15875},
11}