TBD-VLA (Temporal Block Diffusion Vision Language Action Model) is a Vision-Language-Action policy based on Block Discrete Denoising Diffusion. It uses a Qwen3-VL vision-language backbone and predicts robot action chunks through temporal-level block diffusion.
This policy has been trained and pushed to the Hub using a
LeRobot fork.
See the full documentation
here.
1git clone https://github.com/TBD-VLA/lerobot.git
2cd lerobot
3uv python install 3.12
4uv venv --python 3.12
5source .venv/bin/activate
6uv pip install -e ".[libero]"
7uv pip install -U transformers
8uv pip install -U accelerate
1python src/lerobot/scripts/lerobot_train.py \
2 --policy.type=tbdvla \
3 --output_dir=/$OUTPUT_DIR \
4 --dataset.repo_id=sean1295/libero_all \
5 --job_name=tbdvla_experiment \
6 --steps=150000 \
7 --batch_size=4 \
8 --save_freq=20000 \
9 --log_freq=1000 \
10 --policy.device=cuda \
11 --policy.n_bins=512 \
12 --policy.block_temporal_size=4 \
13 --policy.n_diffusion_steps=2 \
14 --policy.gripper_dims=[-1] \
15 --policy.chunk_size=16 \
16 --policy.n_action_steps=16 \
17 --policy.gradient_checkpointing=true \
18 --policy.push_to_hub=false \
19 --wandb.enable=false
1accelerate launch --multi_gpu --num_processes=4 \
2 src/lerobot/scripts/lerobot_train.py \
3 --wandb.enable=false \
4 --num_workers=4 \
5 --policy.type=tbdvla \
6 --policy.push_to_hub=false \
7 --dataset.repo_id=sean1295/libero_all \
8 --steps=150000 \
9 --save_freq=20000 \
10 --log_freq=1000 \
11 --batch_size=16 \
12 --policy.device=cuda \
13 --policy.n_bins=512 \
14 --policy.block_temporal_size=4 \
15 --policy.n_diffusion_steps=2 \
16 --policy.gripper_dims=[-1] \
17 --policy.chunk_size=16 \
18 --policy.n_action_steps=16
1uv run python src/lerobot/scripts/lerobot_eval.py \
2 --policy.path=$CKPT_DIR \
3 --env.type=libero \
4 --env.task=libero_10 \
5 --eval.n_episodes=50 \
6 --eval.batch_size=1 \
7 --eval.use_async_envs=false \
8 --policy.device=cuda \
9 --policy.n_action_steps=12 \
10 --policy.n_diffusion_steps=2 \
11 --policy.compile_model=true
1@article{lee2026tbdvlatemporalblockdiffusion,
2 title={TBD-VLA: Temporal Block Diffusion Vision Language Action Model},
3 author={Lee, Sung-Wook and Kang, Xuhui and Kuo, Yen-Ling},
4 journal={arXiv preprint},
5 year={2026},
6 url={https://arxiv.org/abs/2606.07895}
7}