Vision-language-action model
VLA 모델(Vision-Language-Action Model)은 텍스트, 비디오, 시연(Demonstration)등의 인풋을 받아 액션을 생성하는 로봇 파운데이션 모델들을 일컫는다. 즉, 인공지능 로봇에 들어가는 일종의 생성형 인공지능이다.
Keywords
- 비디오로부터 학습하는 휴머노이드
- VLA 모델의 물리세계 적응과 온디바이스 가속
- 산업용 로봇 자동화 시스템의 인지 및 제어 기능 강화
- AI 모델 경량화 및 최적화
- VLA 기반 영상 관제 솔루션
- High-level Reasoning vs Low-level Control (VLA 아키텍처의 속도 불균형 문제)
- VLA 과적합 문제와 데이터 병목 문제
- Physical Skill Foundation: Sim-to-Real과 Foundation Model 기반 접근
- 모방학습 기반 물체 조작 작업 사례 및 고찰
- 인간형 핸드에 VLA 적용 사례 공유
- 멀티모달 입력 처리를 위한 멀티스테이지 VLA 아키텍쳐
- 산업 현장 적용을 위한 작업 계획 및 로봇 행동 실행 기술
- 작업 환경 이해를 위한 2D, 3D 비전 인식 기술
주요 구조 및 구성 요소
Vision Encoder
- 이미지 또는 영상 프레임을 고차원 표현으로 변환
- ViT, CLIP, ResNet 기반 VLM 사용
Language Encoder
- 텍스트 및 음성 명령을 의미론적 임베딩으로 변환
- GPT, LLaMA, Gemini 1.5, LLM 기반 VLM 활용 (인공지능 활용 정보 공유, 더밀크)
High-Level Policy (상위 정책)
- VLM에 시각+언어 입력과 데모 투어 비디오(long context)를 함께 입력하여 목표 프레임(goal) 예측
- MINT(Multimodal Instruction Navigation with Tours) 과제에서 핵심 역할 (Moonlight)
Low-Level Policy (하위 정책)
- COLMAP를 통해 자동 생성된 위상 그래프(topological graph) 사용
- Dijkstra 방식으로 최단 경로 계획하고, Δx, Δy, Δθ 형태의 행동(wp) 수행 (Moonlight)
통합 구조 흐름
대표 모델 및 최신 연구 동향
- Mobility VLA (Google DeepMind)
- 실세계 836m² 사무실에서 86–90% 성공률 기록 (인공지능 활용 정보 공유)
- 긴 컨텍스트(long-context VLM + Gemini 1.5 프로) 기반, 추론 중심 multimodal 명령 수행 가능 (더밀크)
- VLA의 대표 실현 모델, Vision + Language → 행동으로 동작 직결 (위키백과)
- 7B parameter, 970k robot 시연 데이터 기반 오픈소스 VLA
- RT‑2‑X 대비 16.5% 높은 성공률, different robot architectures 지원 (arXiv)
- 빠른 추론과 데이터 효율성을 갖춘 경량 VLA 모델
- 분산/확산(decoder+a diffusion policy) 구조로 real-world 제어까지 (arXiv)
- 텍스트 지시어에 맞는 시각 피쳐만 선택하여 VLM을 frozen 상태로 활용 지침 직접 실행 가능
- 휴머노이드 상체와 손가락 제어, 다중 로봇 협업까지 지원하는 최초 사례
기술적 이슈 및 해결 전략
- 멀티모달 정렬 & 긴 컨텍스트
- 긴 시연 비디오 + VLM 융합으로 복잡한 자연어 추론 실현 (더밀크, Moonlight)
- 상위: 목표 인식, 하위: 경로 제어로 역할 분할 → 효율성과 정확도 극대화
- 위상 그래프와 COLMAP 사용으로 변화에 강인한 경로 계획
- π0의 FAST, TinyVLA의 diffusion decoder 등 빠른 행동 생성을 위한 연구 진행 (인공지능 활용 정보 공유, learnopencv.com)
응용 분야
- 로봇 내비게이션(Robotic Navigation)
- 서비스/가정용/물류 로봇
- 휴머노이드 일상 제어
- 산업 자동화, 자율 주행 내 행동 명령
- HRI(Human–Robot Interaction), 원격 제어 및 교육
요약 비교표
| 모델명 | 파라미터 | 핵심 특징 |
| Mobility VLA | Gemini 기반 | 긴 컨텍스트 VLM + 위상 그래프 / 실내 내비게이션 특화 |
| RT‑2 | closed | VLA 첫 상용화, 비전·언어→행동 직접 |
| OpenVLA | 7B, 공개 | 다양한 로봇지원, 제로/제로-샷 강점 |
| TinyVLA | 경량 구조 | 추론속도 및 데이터 효율 탁월 |
| OTTER | 개선형 VLM | 시각-언어 정렬 강화, 제로 샷 강력 |
| Helix | 전체 humanoid | 집사 수준 조작 및 협업지원 |
Documentation
- https://arxiv.org/abs/2505.04769
- [2505.04769] Vision-Language-Action (VLA) Models - Concepts, Progress, Applications and Challenges