본문 바로가기

스스로 움직이는 로봇에 왜 ‘에이전트’가 필요할까


최근 AI의 활동 무대가 디지털 공간에서 현실 세계로 빠르게 넓어지고 있습니다. 카메라와 센서로 주변 환경을 인식하고, 상황에 맞춰 판단하며, 실제 로봇의 움직임으로 이어지는 ‘피지컬 AI(Physical AI)’가 대표적입니다.

피지컬 AI를 설명할 때 자주 등장하는 특징 중 하나가 ‘자율성’입니다. 사람이 모든 움직임을 미리 정하지 않아도 AI가 주변 상황을 이해하고 적절한 행동을 선택할 수 있다는 의미입니다.

최근 로봇 분야에서는 ‘에이전트 AI(Agentic AI)’도 함께 주목받고 있습니다. 에이전트 AI 역시 사람이 제시한 목표를 이해하고 스스로 계획을 세워 행동하는 기술로 설명됩니다.

그렇다면 한 가지 질문이 생깁니다.

이미 스스로 판단하고 움직이는 피지컬 AI에 왜 다시 ‘에이전트’가 필요한 걸까요?

현실을 이해하는 피지컬 AI, 목표를 설계하는 에이전트 AI

두 기술의 차이는 자율성의 유무보다 어디에 초점을 두느냐에서 찾을 수 있습니다. 피지컬 AI는 AI가 물리 세계를 인식하고 이해해 실제 행동으로 연결하는 데 초점을 둡니다. 물체가 어디에 있는지 파악하고, 어떤 방식으로 잡아야 하는지 판단한 뒤 로봇의 팔과 손을 움직이는 과정이 여기에 해당합니다.

에이전트 AI는 조금 다른 질문을 다룹니다. ‘주어진 목표를 달성하려면 무엇을 해야 하는가?’

AI로 생성된 이미지

목표를 여러 작업으로 나누고, 어떤 순서로 수행할지 계획하고, 필요한 도구나 로봇을 선택합니다. 작업이 제대로 진행되고 있는지 확인하고 문제가 생겼다면 계획을 수정하는 것도 에이전트의 역할입니다. 쉽게 구분해 보면, 피지컬 AI가 로봇에게 현실에서 ‘행동할 수 있는 능력’을 제공한다면, 에이전트 AI는 여러 행동을 하나의 ‘일’로 조직하는 역할을 한다고 볼 수 있습니다.

예를 들어 로봇에게 “테이블 위의 컵을 선반에 올려줘”라고 지시했다고 생각해 보겠습니다. 로봇이 컵과 선반의 위치를 파악하고, 컵을 어떻게 잡을지 판단해 팔을 움직이는 것은 피지컬 AI의 대표적인 영역입니다. 하지만 “이 방을 정리해 줘”라는 목표가 주어지면 문제는 복잡해집니다. 방 안을 살펴 어떤 물건을 정리해야 하는지 파악하고, 해야 할 일을 나눈 뒤 순서를 정해야 합니다. 물건마다 필요한 행동도 다르고, 진행 중 예상하지 못한 상황이 생기면 계획을 바꿔야 할 수도 있습니다.

로봇이 ‘어떻게 움직일 것인가’와 함께 ‘무엇을 어떤 순서로 해야 할 것인가’까지 판단해야 하는 것입니다.

물론 실제 로봇 AI에서 피지컬 AI와 에이전트 AI의 경계가 명확하게 나뉘는 것은 아닙니다. 최근 VLA(Vision-Language-Action)와 로봇 파운데이션 모델 역시 추론과 계획 능력을 함께 갖추는 방향으로 발전하고 있습니다.

따라서 두 기술을 서로 다른 단계로 구분하기보다는, 물리 세계에서 행동하는 AI에 목표 중심의 계획과 실행 관리 능력이 결합되고 있다고 이해하는 편이 가깝습니다.

목표를 이해하고 행동을 연결하는 로봇 AI

이러한 관계를 구체적으로 보여주는 사례가 Google DeepMind의 Gemini Robotics 2와 Gemini Robotics ER 2입니다. 두 모델의 역할에는 차이가 있습니다.

Gemini Robotics 2는 VLA 모델로, 시각과 언어 정보를 로봇의 실제 움직임으로 변환합니다. 물건을 집거나 도구를 다루는 등 로봇의 물리적 행동을 생성하는 역할을 담당합니다.

Gemini Robotics ER 2는 그보다 상위에서 목표와 상황을 이해하고 작업을 계획하는 embodied reasoning 모델입니다. 주변 환경을 관찰하고 목표 달성에 필요한 단계를 계획한 뒤, 실제 로봇의 동작 실행은 하위 VLA 모델에 맡깁니다. 작업 진행 상황을 확인하면서 실패한 단계는 다시 시도하거나 다음 행동을 조정할 수도 있습니다.

출처 : Google DeepMind, Introducing Gemini Robotics ER 2

이처럼 목표와 상황을 이해해 작업을 계획하는 추론 능력과 실제 물리적 행동을 생성하는 능력이 연결되면서, 로봇은 여러 단계로 이루어진 하나의 일을 수행할 수 있게 됩니다.

여러 로봇을 하나의 목표로 연결하는 오케스트레이션

에이전트의 역할은 여러 로봇과 장비가 함께 움직일 때 더욱 커질 수 있습니다. 실제 산업 현장에서는 하나의 로봇만 존재하지 않습니다. 로봇팔과 AMR, 검사 장비, 각종 생산 설비처럼 서로 다른 기능을 가진 시스템이 함께 움직입니다.

예를 들어 물류 로봇이 필요한 부품을 운반하고 로봇팔이 이를 조립하는 작업에서는 각 로봇의 역할뿐 아니라 작업 순서와 진행 상태를 함께 조율해야합니다. 하나의 목표를 달성하기 위해 이들을 연결한다면 어떤 로봇이 어떤 작업을 맡을지 정하고, 각 작업의 진행 상황에 따라 다음 단계를 조율하는 과정이 필요합니다.

이처럼 서로 다른 로봇과 장비의 능력과 상태를 파악하고 하나의 목표 아래 작업을 배분·조정하는 오케스트레이션(Orchestration)도 피지컬 AI와 에이전트가 결합하면서 중요해지고 있습니다.

로봇 한 대가 얼마나 많은 일을 할 수 있는지뿐 아니라, 서로 다른 능력을 가진 로봇들을 어떻게 하나의 작업 체계로 움직이게 할 것인지가 새로운 과제가 되는 것입니다.

스스로 계획하는 로봇에 필요한 안전과 실행 검증

에이전트가 더 많은 작업을 계획하고 결정하게 되면 또 다른 문제가 생깁니다. AI가 세운 계획을 실제 로봇이 그대로 실행해도 될까요? 디지털 공간에서는 잘못된 결과를 수정하거나 작업을 다시 실행할 수 있습니다. 하지만 현실에서 움직이는 로봇의 행동은 설비나 제품, 사람의 안전에 직접적인 영향을 미칠 수 있습니다.

AI가 논리적으로 적절한 계획을 만들었더라도 현재 로봇이 수행할 수 없는 행동일 수 있습니다. 작업 도중 사람이 로봇의 이동 경로에 들어오거나, 설비 상태가 바뀌면서 처음 세운 계획을 실행하기 어려워질 수도 있습니다. 따라서 에이전트가 계획한 행동과 로봇의 실제 실행 사이에는 현재 상황에서 이 행동이 가능한지, 허용된 범위 안에 있는지 확인하는 과정이 필요합니다.

Xinyuan Liu 외(2026), "Physical Agentic AI", arXiv:2608.22657v1.

최근 공개된 ‘Physical Agentic AI’ 연구에서는 이를 위해 계획과 실행을 분리한 구조를 제안했습니다. AI 기반 Mission Planner가 목표를 여러 단계로 나누고 작업을 계획하면, Robot Orchestrator가 로봇의 기능과 현재 상태, 작업 조건 등을 확인해 계획된 작업을 실제로 수행할 수 있는지 검증한 뒤 실행을 허용하는 방식입니다.

결국 현실 세계의 에이전트에게 필요한 것은 더 많은 것을 스스로 결정하는 능력만은 아닙니다. 어디까지 스스로 판단할 수 있는지, 어떤 행동은 실행 전에 검증해야 하는지, 문제가 발생했을 때 언제 멈추거나 사람의 판단을 요청할 것인지까지 함께 설계해야 합니다.

현장의 인식부터 실행까지 연결하는 자율 에이전트

NC AI도 디지털 공간의 AI와 물리적 현실을 연결하는 자율 에이전트 ‘VAETKI Agent’를 개발하고 있습니다. 현장의 상황을 인식하고 목표 달성을 위한 작업을 계획하는 동시에 AI의 판단을 실제 로봇과 장비의 물리적 제어로 연결하는 오케스트레이션 구조를 구축합니다.

중요한 것은 한 번의 판단과 실행으로 끝나지 않는다는 점입니다.

현장의 상황을 인식하고, 계획을 세우고, 실제 로봇이 행동한 뒤 그 결과를 다시 확인합니다. 예상한 결과와 다르다면 새로운 상황을 반영해 다음 계획을 수정합니다. 이러한 인식 → 계획 → 실행 → 결과 확인의 폐루프(Closed-loop)가 반복되면서 AI의 판단과 현실의 변화가 지속적으로 연결됩니다.

NC AI는 이러한 자율 에이전트를 산업 현장에 적용하기 위해 자율성과 함께 신뢰성과 통제 가능성을 확보하는 구조도 중요하게 보고 있습니다. AI의 판단과 행동을 추적할 수 있도록 기록하고, 에이전트가 스스로 판단할 수 있는 권한과 범위를 설정하는 방식입니다. 위험이 감지되거나 허용된 범위를 벗어나는 상황에서는 로봇의 동작을 안전하게 중단할 수 있는 제어 체계도 필요합니다.

출처 : NC AI Youtube

즉, AI가 더 많은 판단을 스스로 내리도록 하는 것뿐 아니라 그 판단과 행동을 사람이 확인하고 필요한 경우 개입할 수 있는 구조까지 함께 설계하는 것이 산업 현장에서 자율 에이전트를 활용하기 위한 중요한 조건입니다.

피지컬 AI는 AI가 현실 세계를 이해하고 행동할 수 있는 기반을 만듭니다. 여기에 에이전트의 계획과 조정 능력이 결합되면 각각의 행동은 하나의 목표를 달성하기 위한 작업의 흐름으로 연결됩니다. 그 대상이 여러 로봇과 설비로 확장되면 AI의 역할 역시 개별 로봇의 행동을 결정하는 데서 그치지 않고, 현장에서 일이 진행되는 과정까지 계획하고 조율하는 방향으로 넓어집니다.

결국 앞으로 로봇 AI에서 중요한 것은 어떤 동작을 할 수 있는지만이 아닙니다. 주어진 목표를 이해하고 필요한 일을 계획해 실제 물리 세계에서 안전하고 신뢰할 수 있는 방식으로 끝까지 수행할 수 있는가. 피지컬 AI와 에이전트 AI가 만나면서 로봇의 ‘일하는 방식’이 달라지고 있는 이유입니다.

피지컬 AI에이전트 AIVAETKI