RT-2
Google DeepMind · July 28, 2023
● activeClosedencoder decodermultimodal
Parameters55B
Context WindowN/A tokens
Description
First major Vision-Language-Action (VLA) model that translates visual and textual instructions directly into robotic motion commands.
Key Innovations
Multimodal
MultimodalProcessing multiple types of input (text, images, audio, video) in a single model.
robotics
vision-language-action