어떤 로봇에게 보행자는 단순히 움직이는 장애물일 수 있습니다. 혹은 서비스를 제공해야 하는 대상일 수도 있죠. 어떤 관점에서 보더라도, 사람은 로봇에게 중요한 탐구 대상일 수 밖에 없습니다. 사람을 바르게 이해해야만 로봇이 사람과 더욱 안전하고 자연스럽게 공존할 수 있기 때문입니다.
이를 위해 네이버랩스 유럽은 HUMANS 프로젝트를 통해 사람을 깊이 이해하는 로봇 인식 기술을 연구하고 있습니다. 이 프로젝트의 핵심 목표는 로봇이 사람을 안전하고 직관적이며 사회적으로 적절한 방식으로 인식하고 반응하게 하는 것입니다.
로봇이 사람과 자연스럽게 상호작용하기 위해서는 사람의 자세, 동작, 방향 뿐 아니라 사회적 맥락까지 파악할 수 있어야 합니다. HUMANS 프로젝트는 이를 위해 크게 세 가지 주요 기술 축을 중심으로 연구를 진행하고 있습니다.
사람의 자세 복원과 동작 추적
단일 이미지나 영상에서 여러 사람의 전신, 손, 얼굴을 포함한 3D 메쉬를 한 번에 추정하는(single-shot) 기술입니다. 사람을 먼저 감지하고 여러 단계를 거쳐야 했던 기존 방식과 달리, 이미지 전체를 한 번에 처리해 여러 사람을 동시에 복원할 수 있습니다. 이를 통해 로봇은 주변 사람의 자세나 동작, 시선 방향 등을 더 정밀하게 이해해 사람의 움직임이나 의도를 자연스럽게 예측할 수 있습니다.
사람을 포함한 장면의 3D 재구성
복잡한 공간에서의 장면 전체를 사람과 함께 3D로 재구성하는 기술입니다. 단순히 배경과 사람을 분리해 인식하는 수준을 넘어, 사람의 위치와 형태 정보가 담긴 정밀한 3D 포인트맵을 생성함으로써 로봇이 실제 공간을 더 정확하게 인지할 수 있게 합니다.
다양한 신체 특성을 반영하는 3D 인체 모델
사람의 나이, 체형 등 다양한 신체 특성을 파라미터로 손쉽게 조정할 수 있는 3D 인체 모델을 연구하고 있습니다. 하나의 모델에서 슬라이더실제 스캔 데이터가 아닌 인체 계측 기반 모델을 활용해 아이부터 노년층까지 폭넓은 신체 형태를 다룰 수 있으며, 로봇 인식 모델이 다양한 사람을 더욱 공정하고 정확하게 이해할 수 있도록 돕습니다.
이 연구들은 로봇이 사람을 감지하는 단계를 넘어, 이해하는 단계로 발전하도록 이끄는 핵심 요소입니다.
고품질의 데이터도 매우 중요합니다. 특히 손 동작이나 얼굴 표정처럼 작은 신체 부위는 이미지 상에 잘 드러나지 않기 때문에, 이를 학습할 수 있도록 손과 얼굴을 클로즈업한 데이터셋도 제작해 활용하고 있습니다. 다양한 포즈와 몸짓이 포함된 데이터는 로봇이 인간 행동을 더 세밀하게 이해하고 예측하는 데 큰 도움을 줍니다.
HUMANS 프로젝트는 로봇이 사람의 행동을 단편적으로 인식하는 것이 아니라, 보다 풍부하고 입체적인 정보로 이해하도록 기술을 발전시키고자 합니다. 즉, 사람의 행동을 스스로 인식하고, 안전하고 자연스러운 방식으로 반응할 수 있도록 하는 과학적 기반을 마련하는 과정입니다.