RT-2

Google DeepMind · July 28, 2023

activeClosedencoder decodermultimodal
Parameters55B
Context WindowN/A tokens

Description

First major Vision-Language-Action (VLA) model that translates visual and textual instructions directly into robotic motion commands.

Key Innovations

Multimodal
MultimodalProcessing multiple types of input (text, images, audio, video) in a single model.
robotics
vision-language-action

Family Tree

Built On

Lineage

PaLMPaLM-ERT-2

More from Robotics / Embodied