Skip to content

Vision-language-action model

VLA 모델(Vision-Language-Action Model)은 텍스트, 비디오, 시연(Demonstration)등의 인풋을 받아 액션을 생성하는 로봇 파운데이션 모델들을 일컫는다. 즉, 인공지능 로봇에 들어가는 일종의 생성형 인공지능이다.

Keywords

  • 비디오로부터 학습하는 휴머노이드
    • VLA 모델의 물리세계 적응과 온디바이스 가속
  • 변화하는 환경에 적응하는 로봇 행동 (Adapting actions to changing environment)
  • 제조산업 현장의 VLA 기반 온디바이스 AI 개발과 상용화 방안
    • 산업용 로봇 자동화 시스템의 인지 및 제어 기능 강화
    • AI 모델 경량화 및 최적화
    • VLA 기반 영상 관제 솔루션
  • 로봇 행동 학습을 위한 VLM/VLA 모델의 최신 동향과 적용 사례
    • High-level Reasoning vs Low-level Control (VLA 아키텍처의 속도 불균형 문제)
  • Zero-shot 로봇 작업을 향한 Physical AI: 제조 현장 적용 전략
    • VLA 과적합 문제와 데이터 병목 문제
    • Physical Skill Foundation: Sim-to-Real과 Foundation Model 기반 접근
  • 휴머노이드를 위한 VLA 모델 적용방안
    • 모방학습 기반 물체 조작 작업 사례 및 고찰
    • 인간형 핸드에 VLA 적용 사례 공유
  • 산업 현장 적용을 위한 멀티스테이지 VLA 아키텍처와 Physical AI 구현 기술
    • 멀티모달 입력 처리를 위한 멀티스테이지 VLA 아키텍쳐
    • 산업 현장 적용을 위한 작업 계획 및 로봇 행동 실행 기술
    • 작업 환경 이해를 위한 2D, 3D 비전 인식 기술

주요 구조 및 구성 요소

Vision Encoder

  • 이미지 또는 영상 프레임을 고차원 표현으로 변환
  • ViT, CLIP, ResNet 기반 VLM 사용

Language Encoder

  • 텍스트 및 음성 명령을 의미론적 임베딩으로 변환
  • GPT, LLaMA, Gemini 1.5, LLM 기반 VLM 활용 (인공지능 활용 정보 공유, 더밀크)

High-Level Policy (상위 정책)

  • VLM에 시각+언어 입력과 데모 투어 비디오(long context)를 함께 입력하여 목표 프레임(goal) 예측
  • MINT(Multimodal Instruction Navigation with Tours) 과제에서 핵심 역할 (Moonlight)

Low-Level Policy (하위 정책)

  • COLMAP를 통해 자동 생성된 위상 그래프(topological graph) 사용
  • Dijkstra 방식으로 최단 경로 계획하고, Δx, Δy, Δθ 형태의 행동(wp) 수행 (Moonlight)

통합 구조 흐름

[멀티모달 입력(텍스트·이미지·음성) + 시연 비디오] 
→ 상위 정책(VLM 처리) → 목표 프레임 인식 
→ 하위 정책(위상 그래프 기반 경로 생성) 
→ 물리적 이동/조작 수행

대표 모델 및 최신 연구 동향

  • Mobility VLA (Google DeepMind)
    • 실세계 836m² 사무실에서 86–90% 성공률 기록 (인공지능 활용 정보 공유)
    • 긴 컨텍스트(long-context VLM + Gemini 1.5 프로) 기반, 추론 중심 multimodal 명령 수행 가능 (더밀크)
  • RT-2 (Google DeepMind)
    • VLA의 대표 실현 모델, Vision + Language → 행동으로 동작 직결 (위키백과)
  • OpenVLA (Stanford 외)
    • 7B parameter, 970k robot 시연 데이터 기반 오픈소스 VLA
    • RT‑2‑X 대비 16.5% 높은 성공률, different robot architectures 지원 (arXiv)
  • TinyVLA
    • 빠른 추론과 데이터 효율성을 갖춘 경량 VLA 모델
    • 분산/확산(decoder+a diffusion policy) 구조로 real-world 제어까지 (arXiv)
  • OTTER
    • 텍스트 지시어에 맞는 시각 피쳐만 선택하여 VLM을 frozen 상태로 활용 지침 직접 실행 가능
  • Helix (Figure AI)
    • 휴머노이드 상체와 손가락 제어, 다중 로봇 협업까지 지원하는 최초 사례

기술적 이슈 및 해결 전략

  • 멀티모달 정렬 & 긴 컨텍스트
    • 긴 시연 비디오 + VLM 융합으로 복잡한 자연어 추론 실현 (더밀크, Moonlight)
  • 계층적 정책 구성
    • 상위: 목표 인식, 하위: 경로 제어로 역할 분할 → 효율성과 정확도 극대화
  • 실세계 적용 문제 (Sim2Real)
    • 위상 그래프와 COLMAP 사용으로 변화에 강인한 경로 계획
  • 제어 주파수 및 행동 표현
    • π0의 FAST, TinyVLA의 diffusion decoder 등 빠른 행동 생성을 위한 연구 진행 (인공지능 활용 정보 공유, learnopencv.com)

응용 분야

  • 로봇 내비게이션(Robotic Navigation)
  • 서비스/가정용/물류 로봇
  • 휴머노이드 일상 제어
  • 산업 자동화, 자율 주행 내 행동 명령
  • HRI(Human–Robot Interaction), 원격 제어 및 교육

요약 비교표

모델명

파라미터

핵심 특징

Mobility VLA

Gemini 기반

긴 컨텍스트 VLM + 위상 그래프 / 실내 내비게이션 특화

RT‑2

closed

VLA 첫 상용화, 비전·언어→행동 직접

OpenVLA

7B, 공개

다양한 로봇지원, 제로/제로-샷 강점

TinyVLA

경량 구조

추론속도 및 데이터 효율 탁월

OTTER

개선형 VLM

시각-언어 정렬 강화, 제로 샷 강력

Helix

전체 humanoid

집사 수준 조작 및 협업지원

Documentation

https://arxiv.org/abs/2505.04769
[2505.04769] Vision-Language-Action (VLA) Models - Concepts, Progress, Applications and Challenges

See also

Favorite site