VLA
비전-언어-행동 · vision-language-action · 로봇 파운데이션 모델
화면과 말을 함께 받아 로봇의 동작까지 직접 내놓는 모델입니다. 로봇마다 제어기를 새로 짜던 작업을 공통 모델로 옮기는 흐름이고, 구글은 몸체를 만들지 않고 판단층만 표준으로 내놓는 방식을 택했습니다. 기종이 다른 로봇 두 대가 한 작업을 나눠 처리하는 구성까지 시연됐습니다.
‘VLA’ 이 나오는 글1
소식AI
"두뇌 하나로 어떤 로봇이든", 구글 Gemini Robotics ER 2 공개
구글 딥마인드가 7월 30일 로봇 모델 3종 Gemini Robotics 2를 발표하고, 판단을 맡는 ER 2를 Gemini API로 공개했습니다. 사람이 원격으로 몸을 대신 움직여도 성공률은 74.0%였고, 공식 연구 파트너 세 곳 가운데 보스턴다이내믹스의 최대주주는 현대차그룹입니다.

16분
함께 나오는 용어4
- 휴머노이드사람 모양으로 만들어 사람이 쓰던 환경을 그대로 쓰게 하는 로봇입니다. 중국에서는 멀리뛰기와 복싱, 체조까지 종목을 나눈 휴머노이드 종합 경기가 열릴 만큼 균형과 접촉 제어가 올라왔습니다.
- 온디바이스서버를 거치지 않고 노트북이나 휴대폰에서 모델을 직접 돌리는 방식입니다. 양자화와 소형 MoE가 발전하면서 24GB 메모리에서 도는 에이전트급 모델이 나왔습니다.
- 추론 모델답을 내기 전에 중간 과정을 길게 생각하도록 학습한 모델입니다. 어려운 문제에서 정확도가 오르는 대신 응답이 느리고 토큰을 많이 씁니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
