구글 딥마인드, 비디오 생성 모델의 범용 세계 모델 가능성 제시
구글 딥마인드 연구진이 비디오 생성 모델을 활용해 컴퓨터 비전의 범용 세계 모델을 구현할 수 있다는 연구 결과를 발표했습니다. 젠셉션 모델은 적은 학습 데이터로도 기존 전문 모델과 대등한 성능을 보였습니다. 다만 비디오 생성 모델의 물리 법칙 이해도에 대해서는 학계의 논쟁이 이어지고 있습니다.
주장구글 딥마인드 연구진은 비디오 생성 모델이 컴퓨터 비전 분야에서 부족했던 범용 세계 모델의 기초가 될 수 있다고 평가합니다. 모델은 비디오 생성 과정에서 공간 기하학, 물체의 움직임, 물리 법칙을 스스로 학습하며 이는 시각적 이해의 핵심으로 작용합니다.
팩트구글 딥마인드가 개발한 젠셉션은 알리바바의 오픈소스 모델인 완2.1을 기반으로 구축되었습니다. 이 모델은 기존 확산 모델과 달리 단일 순방향 패스를 통해 결과를 생성하며 처리 속도를 높였습니다.
팩트젠셉션은 깊이 추정, 세그멘테이션, 3D 포즈 추정 등 다양한 컴퓨터 비전 작업을 수행합니다. 모델은 모든 출력 결과를 표준 3채널 RGB 이미지로 변환하여 단일 아키텍처로 여러 기능을 구현합니다.
팩트학습 데이터는 7,500개의 합성 비디오로 구성되었습니다. 이는 기존 모델들이 사용하는 수백만 개의 비디오와 비교해 7배에서 500배 적은 양입니다.
팩트젠셉션은 적은 데이터로도 뎁스 애니띵3나 메타의 샘3와 같은 전문 모델과 대등하거나 더 나은 성능을 기록했습니다. 훈련 과정에서는 800개의 디지털 휴먼 모델과 200개의 모션 시퀀스를 블렌더로 렌더링하여 사용했습니다.
팩트실제 비디오 데이터는 언어 기반 세그멘테이션 작업에만 제한적으로 활용되었습니다. 모델의 처리 속도는 여전히 개선이 필요한 과제로 남아 있습니다. 81프레임 비디오를 처리하는 데 작은 모델은 약 6초, 140억 개의 파라미터를 가진 큰 모델은 약 10초가 소요됩니다.
주장연구진은 비디오 생성 모델이 단순히 엔터테인먼트 도구를 넘어 이미지 처리 분야에서 대규모 언어 모델과 같은 역할을 할 수 있다고 강조합니다. 젠셉션은 비디오 생성 능력을 활용해 특정 비전 작업에서 전문 시스템보다 우수한 특징을 추출합니다.
교차검증비디오 생성 모델이 진정한 세계 모델인지에 대해서는 학계의 논쟁이 존재합니다. 일부 연구자는 비디오 생성 모델이 실제 세계와의 상호작용 피드백이 부족하여 물리 법칙을 진정으로 이해하지 못한다고 지적합니다.
교차검증얀 르쿤 등 일부 전문가는 픽셀을 예측하는 생성형 비디오 모델이 한계가 명확한 막다른 길이라고 비판합니다. 칭화대학교의 벤치마크 결과에 따르면 소라와 같은 모델들도 기본적인 물리 법칙과 논리 테스트에서 반복적으로 실패하는 모습을 보였습니다.
주장비디오 생성 모델의 물리적 이해도에 대한 회의적 시각에도 불구하고 연구진은 시각적 데이터의 구조적 학습이 범용 모델로 나아가는 필수 과정임을 재확인합니다.
팩트젠셉션은 비디오 데이터의 효율적 활용 가능성을 입증하며 컴퓨터 비전 모델의 새로운 방향성을 제시했습니다.
출처더 디코더 및 아카이브 논문 자료를 교차 검증했습니다.
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

