요즘 중국의 휴머노이드 로봇 영상을 보면 정말 놀랍습니다. 사람처럼 걷고, 물건을 집어 옮기고, 때로는 사람의 지시에 따라 다양한 작업을 수행하는 모습까지 보여줍니다.
그런데 이런 모습을 보면서 한 가지 궁금증이 생겼습니다.
“로봇은 사람이 하는 말을 어떻게 이해하고 실제 행동으로 옮길 수 있을까요?”
오늘은 이 질문과 연결되는 VLA(Vision-Language-Action)라는 기술을 알아보려고 합니다.
1. 지금까지 무엇을 공부했을까요?
본격적으로 VLA를 살펴보기 전에 「AI가 현장으로 왔다」 시리즈의 지난 세 편을 간단히 돌아보겠습니다.
제1편에서는 AI Value Chain을 공부했습니다. AI 반도체와 데이터센터 같은 인프라부터 AI 모델, 그리고 실제 서비스와 제품까지 AI 산업이 어떻게 연결되는지 살펴봤습니다.
제2편에서는 Physical AI를 알아봤습니다. 화면 속에서 답변을 생성하던 AI가 현실세계를 인식하고 판단하여 로봇이나 자율주행차의 움직임으로 연결되는 개념이었습니다.
제3편에서는 Embodied AI를 살펴봤습니다. AI가 몸과 주변 환경의 상호작용을 통해 지능을 발휘하고, 다양한 작업을 수행하도록 만드는 접근방식이었습니다.
이렇게 공부하다 보니 자연스럽게 다음 질문으로 이어집니다.
“그렇다면 사람의 언어와 로봇이 보는 영상, 그리고 실제 움직임을 하나로 연결하는 기술은 무엇일까요?”
여기에서 등장하는 개념이 바로 VLA입니다.
2. VLA란 무엇일까요?
VLA는 Vision-Language-Action의 약자입니다.
세 단어의 의미를 나눠보면 생각보다 어렵지 않습니다.
- Vision(시각): 카메라 등을 통해 주변 환경과 물체를 인식합니다.
- Language(언어): 사람이 내린 지시를 이해합니다.
- Action(행동): 인식한 상황과 지시를 바탕으로 로봇의 동작을 만들어냅니다.
쉽게 말해 로봇이 보는 것과 사람이 말하는 것을 연결해 실제 행동을 생성하도록 학습한 AI 모델이라고 이해하면 됩니다.
여기에서 중요한 점은 VLA가 단순히 음성명령을 인식하는 기술이 아니라는 것입니다.
로봇은 사람이 말한 내용을 이해하는 동시에 현재 주변 환경까지 고려해야 합니다.
![]() |
| VLA를 설명한 이미지 (출처 - 바이두) |
3. “빨간 상자를 오른쪽 선반에 올려줘”
예를 들어 물류센터에서 로봇에게 이렇게 지시했다고 생각해보겠습니다.
“저기 있는 빨간 상자를 집어서 오른쪽 선반에 올려줘.”
사람에게는 아주 간단한 지시입니다. 하지만 로봇이 이를 수행하려면 여러 과정이 필요합니다.
먼저 카메라로 주변을 살펴보면서 빨간 상자가 어디에 있는지 찾아야 합니다. 다음으로 오른쪽 선반의 위치를 확인하고, 상자를 어떻게 집어야 할지 판단해야 합니다.
그 후 로봇팔과 손을 움직여 상자를 집고, 지정된 위치에 내려놓아야 합니다.
이 과정을 단순화하면 다음과 같습니다.
사람의 지시 + 카메라 영상 → VLA 모델 → 로봇의 행동
물론 실제 로봇에는 관절 제어, 충돌 방지, 안전장치 등 여러 기술이 추가로 필요합니다.
VLA가 로봇의 모든 기능을 혼자 해결하는 것은 아닙니다. 다만 언어와 시각 정보를 행동으로 연결하는 중요한 역할을 담당합니다.
4. 기존 산업용 로봇과 무엇이 다를까요?
기존 산업용 로봇은 정해진 위치에서 동일한 동작을 반복하는 데 매우 뛰어납니다.
자동차 공장의 용접 로봇이나 정해진 물건을 반복해서 옮기는 로봇팔이 대표적입니다.
하지만 물건의 위치나 작업 내용이 계속 달라진다면 이야기가 달라집니다.
새로운 작업을 수행하기 위해 프로그램을 수정하거나 별도의 설정이 필요할 수 있습니다.
VLA가 주목받는 이유는 다양한 작업을 자연어 지시와 시각 정보로 연결해 수행할 가능성을 보여주기 때문입니다.
예를 들어 오늘은 부품을 상자에 담고, 내일은 다른 부품을 분류하는 작업을 수행하도록 지시하는 것입니다.
물론 현재 기술 수준에서 모든 작업을 사람처럼 자유롭게 수행할 수 있는 것은 아닙니다.
학습하지 않은 환경이나 물체를 만나면 실패할 수 있고, 실제 현장에서 요구하는 정확도와 안전성을 확보하는 것도 여전히 중요한 과제입니다.
5. 중국 휴머노이드 기업들이 VLA에 주목하는 이유
저는 중국의 로봇기업들을 만나면서 처음에는 로봇의 하드웨어 성능에 많은 관심을 가졌습니다.
얼마나 잘 걷는지, 손가락을 얼마나 정교하게 움직이는지, 배터리는 얼마나 오래 사용할 수 있는지 등이었습니다.
그런데 최근에는 조금 다른 부분이 궁금해졌습니다.
“이 로봇은 새로운 작업을 얼마나 쉽게 배울 수 있을까?”
아무리 로봇의 움직임이 뛰어나더라도 새로운 작업마다 복잡한 프로그램을 다시 만들어야 한다면 활용 범위가 제한될 수밖에 없습니다.
반대로 하나의 AI 모델을 기반으로 다양한 작업을 수행할 수 있다면 로봇의 활용 가능성은 크게 넓어질 것입니다.
이러한 방향을 보여주는 대표적인 연구 중 하나가 Google DeepMind의 RT-2입니다. RT-2는 웹과 로봇 데이터를 활용해 시각·언어 정보를 로봇 행동으로 연결하는 VLA 연구 사례입니다.
중국에서도 휴머노이드 기업들이 로봇의 지능과 학습 능력을 강화하는 방향으로 경쟁하고 있습니다.
다만 실제 기업별 VLA 적용 수준과 상용화 성과는 각각 구분해서 확인할 필요가 있습니다.
6. 제조·물류 현장에서는 어떤 의미가 있을까요?
제가 관심을 갖는 부분은 결국 제조공장과 물류센터에서의 활용 가능성입니다.
예를 들어 물류센터에는 크기와 모양이 서로 다른 상품들이 끊임없이 들어옵니다.
제조공장에서도 제품 종류가 바뀌거나 생산계획이 변경되면 작업 내용이 달라질 수 있습니다.
이런 환경에서 로봇이 사람의 지시를 이해하고 상황에 맞게 행동할 수 있다면 유연한 자동화에 도움이 될 것입니다.
하지만 기업 입장에서 가장 중요한 것은 화려한 시연이 아닙니다.
- 작업 성공률은 얼마나 높은가?
- 새로운 작업을 학습하는 데 얼마나 걸리는가?
- 작업 환경이 바뀌어도 안정적으로 작동하는가?
- 기존 MES·WMS와 연동할 수 있는가?
- 도입 비용 대비 생산성 개선 효과가 있는가?
이러한 질문에 답할 수 있어야 실제 사업으로 연결될 수 있다고 생각합니다.
특히 현재의 산업용 로봇이 더 빠르고 경제적인 작업이라면 굳이 휴머노이드나 VLA를 적용할 필요는 없습니다.
중요한 것은 최신 기술을 도입하는 것이 아니라, 기존 자동화로 해결하기 어려운 문제를 더 효율적으로 해결하는 것입니다.
7. VLA가 휴머노이드의 미래를 바꿀까요?
오늘은 VLA라는 새로운 개념을 공부해봤습니다.
제가 이해한 VLA를 한 문장으로 정리하면 다음과 같습니다.
“VLA는 로봇이 주변 환경을 보고, 사람의 지시를 이해하며, 이를 실제 행동으로 연결하도록 만드는 AI 모델이다.”
지난 네 편의 내용을 다시 연결해보면 AI 산업의 전체 구조에서 출발해, 현실세계에서 행동하는 AI와 몸을 통해 지능을 발휘하는 AI, 그리고 언어와 시각을 행동으로 연결하는 기술까지 살펴본 셈입니다.
물론 VLA가 휴머노이드의 유일한 지능 구현 방식은 아닙니다. 하지만 로봇이 다양한 작업을 수행하도록 만드는 중요한 연구 방향 중 하나라는 점은 분명해 보입니다.
그렇다면 다음에는 이런 질문이 생깁니다.
“그런데 왜 로봇은 굳이 사람처럼 생겨야 할까요?”
바퀴 달린 로봇이나 기존 로봇팔이 더 효율적인 경우도 많은데, 세계의 기업들은 왜 휴머노이드 개발에 막대한 투자를 하고 있을까요?
「AI가 현장으로 왔다」 제5편에서는 '왜 휴머노이드인가?'라는 질문을 함께 고민해보겠습니다.
저도 중국의 제조·물류 현장을 바라보는 관점에서 하나씩 공부하며 정리해보겠습니다.
이상 밥무쓰리부팅이었습니다. 감사합니다.



댓글 쓰기