[언론보도] 서울공대 전기정보공학부 이경한 교수팀, 물체 움직임 추적해 영상 분석 속도 높인 AI 시스템 ‘Ouroboros’ 개발
▲ 서울대학교 전기·정보공학부 이경한 교수(왼쪽), 박찬정 연구원(오른쪽)
연구 개요
서울대학교 공과대학은 전기정보공학부 이경한 교수 연구팀이 비전 트랜스포머(Vision Transformer) 기반 비디오 분석을 엣지 기기에서 빠르고 기존 대비 2.61배 효율적으로 수행하는 AI 시스템 ‘Ouroboros’를 개발했다고 밝혔다.
Ouroboros는 연속된 영상 프레임에서 반복적으로 나타나는 시각 정보를 다시 계산하지 않고 재사용하는 기술이다. 특히 영상 속 물체와 배경이 움직이더라도 그 움직임을 추적해 동일한 시각 정보를 찾아내고, 실제로 변화가 큰 부분만 선택적으로 계산한다.
이를 통해 연구팀은 고성능 영상 AI 모델의 정확도를 유지하면서도 연산량, 지연시간, 에너지 소모를 크게 줄였다. 이번 연구는 전력과 연산 자원이 제한된 환경에서 주로 동작하는 Physical AI·증강현실 응용에서 실시간 영상 AI를 상용화하는 데 결정적인 기여를 할 것으로 기대된다.
이번 연구 성과는 오는 6월 22일부터 24일까지 영국 캠브리지에서 열리는 모바일 시스템 분야 최고 권위의 국제 학술대회 ‘ACM MobiSys 2026’에서 발표될 예정이다. 본 연구는 행사 이틀 차인 23일에 구두 발표로 공개된다.
연구 배경(필요성)
최근 비전 트랜스포머는 객체 탐지, 영상 분할, 자율주행 인식 등 다양한 시각 인공지능 분야에서 높은 성능을 보이고 있다. 그러나 입력 영상을 여러 패치로 나누고 모든 패치 간 관계를 계산하는 구조적 특성 때문에 연산량과 메모리 사용량이 크며, 모바일·로봇·드론과 같은 엣지 기기에서 실시간으로 활용하기 어렵다는 한계가 있었다.
한편, 비디오는 연속된 프레임이 서로 매우 유사하다는 특징을 갖는다. 도로 위 차량이나 보행자처럼 이전 프레임에 있던 대상이 다음 프레임에서 조금 이동해 나타나는 경우가 많기 때문이다. 따라서 이전 프레임에서 계산한 정보를 재사용할 수 있다면 불필요한 반복 연산을 크게 줄일 수 있다.
기존 비디오 AI 경량화 기법은 주로 같은 위치의 픽셀 차이나 프레임 차이를 기준으로 중복성을 판단했다. 이 경우 카메라가 흔들리거나 객체가 움직이면 실제로는 같은 내용인 영역도 새롭게 계산해야 하는 문제가 있었다. 연구팀은 이러한 한계를 해결하기 위해 영상 속 움직임 자체를 반영하는 새로운 중복 계산 제거 기술을 제안했다.
연구 성과
연구팀이 개발한 Ouroboros는 하드웨어 비디오 인코더에서 얻은 움직임 벡터를 활용해 연속된 프레임을 공통 좌표계에 정렬한다. 이를 통해 같은 물체나 배경이 화면 안에서 이동하더라도 동일한 시각 정보로 인식하고, 이전 계산 결과를 재사용할 수 있도록 했다.
또한 프레임이 이동하면서 일부 영상 정보가 입력 영역 밖으로 벗어나는 문제를 해결하기 위해, 화면의 좌우·상하 경계를 이어 붙인 순환형 입력 공간을 도입했다. 여기에 위치 인코딩 재배치 기술을 결합해, 경계를 넘어 이동한 물체도 하나의 연속된 대상으로 인식할 수 있도록 했다.
시스템 구현 측면에서는 모든 패치를 다시 계산하는 대신, 변화가 큰 패치만 선택적으로 처리하고 나머지는 이전 프레임에서 저장한 계산 결과를 재사용했다. 이 과정에서 메모리 접근 비용을 줄이는 부분 계산 방식을 함께 설계해, 이론적인 연산량 절감이 실제 속도 및 에너지 개선으로 이어지도록 했다.
실험 결과, Ouroboros는 NVIDIA Jetson Orin 계열 엣지 기기에서 최대 87.0%의 연산량 절감, 2.61배 추론 가속, 64.5% 에너지 절감을 달성했다. 객체 탐지와 인스턴스 분할 작업에서 정확도 손실은 1% 미만으로 유지했으며, 서버 오프로딩 환경에서도 기존 방식보다 낮은 네트워크 대역폭으로 높은 정확도를 보였다.
기대 효과(상용화 등)
Ouroboros는 비전 트랜스포머 모델 자체를 새로 설계하는 방식이 아니라, 연속된 영상 입력을 처리하는 과정에서 중복 계산을 줄이는 시스템 기술이다. 따라서 다양한 비전 트랜스포머 계열 모델에 결합할 수 있으며, 향후 더 큰 영상 AI 모델이나 엣지-서버 협력형 AI 시스템으로 확장될 수 있다.
특히 고성능 영상 AI 모델을 제한된 전력과 연산 자원을 가진 엣지 기기에서 실행하기 위한 기반 기술로 활용될 수 있다. 자율주행, 지능형 CCTV, 드론, 로봇, 모바일 증강현실, 스마트팩토리 등 실시간 영상 분석이 필요한 분야에서 응용 가능성이 크다.
또한 전체 영상을 모두 전송하지 않고 인공지능 추론에 필요한 패치 단위 정보를 선별적으로 처리할 수 있어, 영상을 서버로 전송하여 추론 결과를 받아오는 경우에도 제한된 네트워크 대역폭 하에서 안정적인 영상 분석 서비스를 제공하는 데 기여할 것으로 기대된다.
연구책임자 의견
연구를 지도한 이경한 교수는 “휴머노이드 형 Physical AI 실현의 걸림돌인 연산 병목과 네트워크 병목 문제를 동시에 해결하는 원천기술을 확보했다는 점에서 의미가 깊다”고 밝혔다. 이어 이경한 교수는 “Physical AI 및 AI 반도체 기업들과 협력하여 Ouroboros 기술 상용화 및 사업화를 적극적으로 추진할 계획”이라고 밝혔다.
주저자 진로
연구팀은 이번 연구를 바탕으로 비디오뿐 아니라 단일 이미지 입력에 대해서도 엣지-클라우드 협업 추론을 가속하는 후속 연구를 진행할 예정이다.
주저자인 박찬정 연구원은 현재 서울대학교 공과대학 전기정보공학부에 재학 중이며, 엣지 기기와 클라우드가 협력해 고성능 인공지능 추론을 효율적으로 수행하는 시스템 연구를 이어가고 있다. 향후 학위 취득 후에는 박사후연구원으로 관련 연구를 지속적으로 수행하며, 제한된 연산·통신 자원 환경에서도 대규모 인공지능 모델을 실시간으로 활용할 수 있는 시스템 기술을 발전시켜 나갈 계획이다.
이번 연구는 서울대학교와 미국 카네기멜론대학교(Carnegie Mellon University)의 공동 연구로 수행됐다. 본 연구는 과학기술정보통신부 재원으로 정보통신기획평가원(IITP)과 한국연구재단(NRF)의 지원을 받아 이루어졌으며, 서울대학교 공학연구원 및 뉴미디어통신공동연구소의 지원도 함께 받았다.
