요즘 AI 관련 뉴스를 보다 보면 Physical AI, Embodied AI, 휴머노이드라는 단어를 자주 접하게 됩니다.
그런데 이 단어들이 서로 어떤 관계인지 설명하려고 하면 생각보다 쉽지 않습니다.
저 역시 중국에서 여러 AI·로봇 기업을 만나고 관련 기술을 접하면서, 단순히 로봇이 얼마나 잘 움직이는지를 보는 것보다 그 로봇이 어떻게 세상을 이해하고 새로운 작업을 배우는지가 더 궁금해졌습니다.
그래서 시작한 시리즈가 바로 「AI가 현장으로 왔다」입니다.
오늘은 제3편으로 넘어가기 전에 지난 두 편에서 무엇을 공부했는지 간단히 돌아보려고 합니다.
AI Value Chain에서 Physical AI까지, 지난 이야기
제1편|AI 산업은 어떻게 연결되어 있을까요?
첫 번째 글에서는 AI Value Chain(인공지능 가치사슬)을 살펴봤습니다.
우리가 사용하는 ChatGPT 같은 AI 서비스 뒤에는 전력과 데이터센터, GPU와 같은 AI 반도체, 그리고 AI 모델이 있다는 이야기였습니다.
INFRA → MODEL → SERVICE / PRODUCT
AI 산업 전체를 이해하기 위한 가장 간단한 지도라고 생각하면 됩니다.
👉 [AI가 현장으로 왔다] 제1편|AI Value Chain이란? AI 산업 구조를 한눈에 이해하기
제2편|AI가 화면 밖으로 나오면 어떻게 될까요?
두 번째 글에서는 Physical AI(피지컬 AI)를 살펴봤습니다.
ChatGPT 같은 생성형 AI가 주로 글과 이미지 등의 결과물을 만들어낸다면, Physical AI는 현실세계를 인식하고 판단하여 실제 행동으로 연결하는 AI라는 내용이었습니다.
현실세계 인식 → AI 판단 → 물리적 행동
자율주행 자동차, AMR, 로봇팔, 휴머노이드 등으로 연결되는 개념이었습니다.
👉 [AI가 현장으로 왔다] 제2편|Physical AI란? 생각하는 AI에서 행동하는 AI로
그런데 여기에서 또 하나의 궁금증이 생겼습니다.
“AI가 로봇의 몸을 갖게 되면, 사람처럼 세상을 이해하고 새로운 일을 배울 수 있을까요?”
오늘 제3편에서는 바로 이 질문을 살펴보려고 합니다.
이번 주제는 Embodied AI(체화 인공지능), 중국어로는 具身智能(쥐선즈넝)입니다.
1. Embodied AI란 무엇일까요?
Embodied라는 영어 단어는 '몸을 가진', '몸으로 구현된'이라는 의미를 담고 있습니다.
그래서 Embodied AI를 쉽게 표현하면 몸을 통해 주변 환경과 상호작용하면서 지능을 발휘하는 AI라고 이해할 수 있습니다.
여기서 중요한 것은 단순히 AI 프로그램을 로봇에 설치하는 것이 아닙니다.
로봇이 카메라로 물건을 보고, 팔을 움직여 물건을 잡고, 그 과정에서 발생하는 변화를 다시 인식하며 움직임을 조절하는 것.
이처럼 인식, 행동, 환경의 변화가 서로 연결되는 과정이 핵심입니다.
인식(Perception) → 행동(Action) → 환경의 변화 → 다시 인식(Feedback)
한 번 판단하고 끝나는 것이 아니라, 행동한 결과를 다시 확인하면서 다음 행동을 결정하는 것입니다.
이런 방식의 지능은 실제 로봇뿐 아니라 가상환경에서 움직이는 AI 에이전트를 연구할 때도 중요합니다.
2. 사람은 컵 하나를 어떻게 집을까요?
책상 위에 커피잔이 있다고 생각해보겠습니다.
우리는 별다른 고민 없이 손을 뻗어 컵을 집습니다.
그런데 이 간단한 행동을 조금 자세히 살펴보면 상당히 복잡한 과정이 숨어 있습니다.
먼저 눈으로 컵의 위치와 모양을 확인합니다.
손을 어느 방향으로 움직일지 판단하고, 컵을 잡을 때 필요한 힘을 조절합니다.
컵이 미끄러질 것 같으면 손가락에 힘을 더 주고, 컵을 들어 올리면서도 계속 움직임을 조정합니다.
사람에게는 너무나 자연스러운 행동입니다.
하지만 로봇에게는 전혀 다른 문제입니다.
컵의 위치가 조금 달라지거나, 재질이 바뀌거나, 안에 담긴 내용물의 무게가 달라지면 움직임을 다시 조절해야 하기 때문입니다.
더구나 실제 공장에서는 컵보다 훨씬 복잡한 형태의 부품과 제품을 다루게 됩니다.
Embodied AI에서 중요한 것은 단순히 몸을 움직이는 것이 아니라, 몸과 환경의 상호작용을 통해 상황에 맞는 행동을 만들어내는 능력입니다.
3. Physical AI와 Embodied AI는 무엇이 다를까요?
지난 제2편을 읽으셨다면 이런 의문이 생길 수 있습니다.
“그런데 이것은 Physical AI와 같은 이야기 아닌가요?”
맞습니다. 실제로 두 개념은 상당 부분 겹칩니다.
학계와 산업계에서도 두 용어를 완전히 분리해서 사용하지는 않습니다.
다만 이해를 돕기 위해 강조하는 관점을 구분해보면 다음과 같습니다.
| 구분 | 핵심 관점 |
|---|---|
| Physical AI | AI가 물리적 환경을 인식하고 현실세계에서 행동하는 능력에 초점 |
| Embodied AI | 몸과 환경의 상호작용을 통해 지능이 구현되고 학습되는 방식에 초점 |
예를 들어 자율주행 자동차가 주변 차량과 보행자를 인식하고 움직이는 것은 Physical AI의 대표적인 사례입니다.
반면 로봇이 물건을 집으면서 접촉 정보를 받아 움직임을 조절하거나, 여러 번의 경험을 통해 새로운 작업을 학습하는 과정은 Embodied AI의 관점에서 이해하기 좋습니다.
물론 하나의 휴머노이드 로봇에 두 개념이 동시에 적용될 수 있습니다.
따라서 Physical AI 다음에 Embodied AI라는 별도의 기술이 반드시 순서대로 들어가는 것은 아닙니다.
저는 두 개념을 서로 다른 단계로 외우기보다, AI가 현실세계에서 행동하는 모습을 서로 다른 관점에서 설명하는 용어로 이해하는 것이 더 좋다고 생각합니다.
4. AI가 몸을 가진다고 곧바로 똑똑해질까요?
그렇지는 않습니다.
사람처럼 생긴 로봇을 만들었다고 해서 곧바로 사람처럼 일할 수 있는 것은 아닙니다.
예를 들어 공장에서 로봇에게 이렇게 지시했다고 생각해보겠습니다.
“저기 있는 부품을 집어서 오른쪽 상자에 넣어줘.”
사람이라면 간단하게 이해할 수 있는 말입니다.
하지만 로봇은 먼저 어떤 부품을 말하는지 알아야 합니다.
그 부품이 정확히 어디에 있는지 찾아야 하고, 어느 부분을 잡아야 안전한지도 판단해야 합니다.
그다음 팔과 손가락을 움직여 실제로 부품을 집어야 합니다.
만약 부품을 떨어뜨렸다면 상황을 다시 인식하고 대응해야 합니다.
이 과정에는 여러 기술이 필요합니다.
- 시각 인식: 어떤 물체가 어디에 있는지 파악
- 공간 이해: 물체와 로봇 사이의 거리와 위치 판단
- 행동 계획: 어떤 순서로 움직일지 결정
- 동작 제어: 팔과 손가락 등을 정확하게 움직임
- 피드백: 행동 결과를 확인하고 필요한 경우 수정
결국 로봇이 실제 작업을 수행하려면 단순히 언어를 이해하는 능력만으로는 부족합니다.
보고, 이해하고, 움직이고, 그 결과에 다시 대응하는 능력이 함께 필요합니다.
5. 그렇다면 로봇은 어떻게 새로운 작업을 배울까요?
여기에서 제가 최근 중국의 휴머노이드 기업들을 보면서 관심을 갖게 된 부분이 있습니다.
바로 로봇 학습 데이터(Robot Training Data)입니다.
사람은 다른 사람이 하는 일을 보고 따라 하거나, 직접 시행착오를 겪으면서 새로운 작업을 배웁니다.
로봇도 여러 방법을 통해 새로운 작업을 학습할 수 있습니다.
① 사람이 작업을 보여주는 방법
사람이 로봇을 원격으로 조작하거나 직접 작업을 시연하면, 로봇은 그 과정에서 영상과 동작 데이터를 수집할 수 있습니다.
이런 데이터를 이용해 사람의 행동을 모방하도록 학습시키는 방법을 모방학습(Imitation Learning)이라고 합니다.
② 가상환경에서 반복해서 연습하는 방법
실제 공장에서 로봇을 수없이 넘어뜨리거나 충돌시키면서 학습시키기는 어렵습니다.
그래서 실제와 비슷한 가상환경에서 다양한 상황을 경험하도록 학습시키기도 합니다.
이 과정에는 시뮬레이션과 강화학습(Reinforcement Learning) 같은 기술이 활용됩니다.
③ 실제 환경에서 결과를 확인하는 방법
가상환경에서 잘 움직이던 로봇도 실제 현장에서는 예상과 다르게 행동할 수 있습니다.
바닥의 마찰, 조명, 물체의 무게, 센서 오차 등 현실세계에는 다양한 변수가 있기 때문입니다.
따라서 가상환경에서 학습한 결과를 실제 로봇에 적용하고 검증하는 과정도 중요합니다.
이와 관련해 자주 등장하는 용어가 Sim-to-Real입니다.
물론 모든 로봇이 이 세 가지 방법을 동일하게 사용하는 것은 아닙니다.
작업 종류와 로봇의 구조, 학습 모델에 따라 접근 방법은 달라집니다.
하지만 한 가지는 분명합니다.
“로봇의 경쟁력은 하드웨어뿐 아니라 어떤 데이터를 확보하고, 어떻게 학습시키며, 실제 현장에서 얼마나 안정적으로 작동하는가에 달려 있다.”
이전에 정리했던 「중국 물류 이야기」에서도 자동화 기술이 휴머노이드와 로봇 학습 데이터로 확장되는 과정을 살펴봤습니다.
👉 [중국 물류 이야기] 시즌1 총정리 1부|자동화에서 휴머노이드와 학습 데이터까지
6. 중국 휴머노이드 기업을 보는 시선도 달라졌습니다
저는 중국에서 오랫동안 제조와 물류 관련 기업들을 접해왔습니다.
최근에는 휴머노이드 기업들을 만나고 제품을 보면서 기술의 발전 속도를 실감하고 있습니다.
특히 로봇이 걷고, 뛰고, 춤추는 모습을 보면 정말 놀랍습니다.
하지만 이제는 조금 다른 질문을 하게 됩니다.
“이 로봇은 처음 보는 물건도 집을 수 있을까?”
“작업 위치가 달라져도 스스로 대응할 수 있을까?”
“새로운 작업을 배우려면 얼마나 많은 데이터와 시간이 필요할까?”
이런 질문은 로봇의 외형보다 그 안에 있는 지능과 학습 능력을 살펴보게 만듭니다.
중국의 대표적인 로봇기업인 Unitree(宇树科技)의 성장 과정을 살펴본 글에서도 중국 로봇산업의 빠른 변화를 정리한 적이 있습니다.
👉 [중국기업을 읽다] 제2편|Unitree는 어떻게 세계적인 로봇기업으로 성장했을까?
다만 로봇의 동작 시연이 뛰어나다고 해서 곧바로 제조공장에서 안정적으로 일할 수 있다는 뜻은 아닙니다.
실제 현장에서는 반복 작업의 성공률과 안전성, 유지보수, 비용까지 함께 검토해야 합니다.
7. 제조·물류 현장에서 Embodied AI가 중요한 이유
이제 제가 가장 관심을 갖는 제조·물류 현장으로 돌아와 보겠습니다.
기존 산업용 로봇은 정해진 위치에서 동일한 작업을 빠르고 정확하게 반복하는 데 뛰어납니다.
하지만 실제 현장에는 항상 똑같이 반복되지 않는 작업도 많습니다.
예를 들어 다음과 같은 작업입니다.
- 물류 피킹: 크기와 모양이 다른 상품을 찾아 집는 작업
- 부품 조립: 위치가 조금씩 달라지는 부품을 정확하게 조립하는 작업
- 혼합 상품 분류: 다양한 형태의 물건을 인식하고 분류하는 작업
- 예외 상황 대응: 물체의 위치나 작업 환경이 바뀌었을 때 행동을 조절하는 작업
이런 작업에서는 주변 상황을 인식하고 그에 맞게 행동을 조절하는 능력이 중요합니다.
Embodied AI 연구가 제조·물류 분야에서 주목받는 이유도 여기에 있습니다.
하지만 기술적으로 작업을 수행할 수 있다는 것과 실제 공장에 도입할 가치가 있다는 것은 다릅니다.
기업 입장에서는 다음과 같은 질문을 반드시 해야 합니다.
- 작업 성공률은 얼마나 높은가?
- 사람과 비교해 작업 속도는 어느 정도인가?
- 현장 환경이 달라져도 안정적으로 작동하는가?
- 기존 MES·WMS·자동화 설비와 연동할 수 있는가?
- 투자비와 유지보수비를 고려해 경제성이 있는가?
저는 앞으로 휴머노이드 기업을 볼 때 이런 질문들이 더욱 중요해질 것이라고 생각합니다.
실제로 중국 휴머노이드 산업에서도 기술에 대한 기대와 함께 사업성과 수익성 검증의 중요성이 제기되고 있습니다.
👉 [News Or Nius] #56|중국도 로봇 거품을 걱정하기 시작했다?
8. Embodied AI를 한 문장으로 정리한다면
오늘은 조금 생소한 Embodied AI(체화 인공지능)에 대해 공부해봤습니다.
저 역시 아직 공부하는 과정이지만, 오늘 내용을 가장 쉽게 표현한다면 이렇게 정리하고 싶습니다.
“Embodied AI는 AI가 몸과 환경의 상호작용을 통해 세상을 인식하고, 행동을 조절하며, 새로운 작업을 수행하도록 만드는 지능의 접근방식이다.”
지금까지의 시리즈를 다시 연결해보겠습니다.
제1편|AI Value Chain
AI 산업 전체는 어떻게 구성되어 있을까요?
제2편|Physical AI
AI가 현실세계에서 행동한다는 것은 무엇일까요?
제3편|Embodied AI
AI는 몸과 환경의 상호작용을 통해 어떻게 지능을 발휘할까요?
이렇게 하나씩 공부하다 보니 처음에는 서로 다른 기술처럼 느껴졌던 AI와 로봇, 휴머노이드가 조금씩 연결되기 시작합니다.
그런데 여기에서 또 하나의 질문이 생깁니다.
“사람의 언어와 로봇이 보는 영상, 그리고 실제 움직임을 하나의 AI 모델로 연결할 수는 없을까요?”
바로 이 질문에서 VLA(Vision-Language-Action)라는 개념이 등장합니다.
「AI가 현장으로 왔다」 제4편에서는 VLA란 무엇인지, 로봇이 사람의 말을 어떻게 실제 행동으로 바꾸는지를 가능한 쉽게 알아보겠습니다.
그리고 이후에는 휴머노이드 학습, 중국 로봇기업들의 기술 변화, 실제 제조·물류 현장 적용과 투자 대비 효과까지 차례로 살펴보려고 합니다.
저도 하나씩 공부하면서 계속 정리해보겠습니다.
이상 밥무쓰리부팅이었습니다. 감사합니다.


댓글 쓰기