세계적인 컴퓨터비전 학회 ECCV 2026에 네이버랩스의 공간지능 연구들이 채택됐습니다. 이번에 공개된 연구를 통해 3D 공간 재구성, 자율주행을 위한 객체 인식, 실내 3D 공간 생성 등 현실 공간을 더욱 빠르고 정교하게 이해하는 방법을 제시했습니다.
네이버랩스 유럽은 글로벌 3D 비전 분야에서 주목받은 ‘DUSt3R’의 후속 연구인 BLASt3R를 발표했습니다. (BLASt3R: Bundle Adjustment of Any Image Set with Multi-view Matching and Monocular Priors)
BLASt3R는 여러 이미지 사이의 관계를 분석해 공간을 입체적으로 복원하는 기술입니다. 기존 모델보다 3D 재구성의 속도와 정확도를 크게 높였으며, 로봇이 이동하면서 자신의 위치를 추정하고 주변 지도를 만드는 SLAM 기술을 접목했습니다. 이를 통해 서버에만 의존하지 않고 로봇과 같은 온디바이스 환경에서도 3D 공간을 실시간으로 재구성할 수 있는 가능성을 넓혔습니다.
자율주행 분야에서는 Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints 연구가 채택됐습니다. 자율주행 시스템이 미리 학습한 사물뿐 아니라 처음 마주한 물체까지 인식하도록 하는 기술입니다.
이 연구는 비전 언어 모델(VLM)을 활용해 이미지 속 물체의 의미를 파악하고, 그 결과를 실시간 버드아이뷰(BEV) 지도에 반영합니다. 버드아이뷰는 주변 환경을 위에서 내려다본 것처럼 표현한 지도로, 차량이나 로봇이 물체의 위치와 공간적 관계를 이해하는 데 활용됩니다. 정해진 범주의 사물만 구분하는 방식을 넘어 낯선 환경에도 유연하게 대응할 수 있다는 점에서 의미가 있습니다.
실내 공간을 생성하는 InSpace 연구는 한 장의 360도 파노라마 이미지만으로 방의 구조와 내부 사물을 3D 공간으로 재구성하는 기술입니다. (InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image)
제한된 이미지 정보만으로 벽과 바닥 같은 공간의 구조를 파악하고, 그 안에 놓인 사물까지 함께 구현한다는 것이 핵심입니다. 이 연구는 학술적 우수성을 인정받아 전체 제출작 가운데 약 1~2%에만 주어지는 ‘ECCV Spotlight’에 선정됐습니다.
이번 연구들은 서로 다른 분야를 다루지만 하나의 공통된 방향을 향하고 있습니다. AI가 이미지를 단순히 인식하는 수준을 넘어 공간의 구조와 사물의 위치, 주변 환경의 변화를 종합적으로 이해하도록 만드는 것입니다.