MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 7월 20일 월요일

AI 시대, 당신을 더욱 스마트하게

AI미검

구글 딥마인드, 비디오 생성 모델의 범용 세계 모델 가능성 제시

구글 딥마인드 연구진이 비디오 생성 모델을 활용해 컴퓨터 비전의 범용 세계 모델을 구현할 수 있다는 연구 결과를 발표했습니다. 젠셉션 모델은 적은 학습 데이터로도 기존 전문 모델과 대등한 성능을 보였습니다. 다만 비디오 생성 모델의 물리 법칙 이해도에 대해서는 학계의 논쟁이 이어지고 있습니다.

2026년 7월 19일

주장구글 딥마인드 연구진은 비디오 생성 모델이 컴퓨터 비전 분야에서 부족했던 범용 세계 모델의 기초가 될 수 있다고 평가합니다. 모델은 비디오 생성 과정에서 공간 기하학, 물체의 움직임, 물리 법칙을 스스로 학습하며 이는 시각적 이해의 핵심으로 작용합니다.

팩트구글 딥마인드가 개발한 젠셉션은 알리바바의 오픈소스 모델인 완2.1을 기반으로 구축되었습니다. 이 모델은 기존 확산 모델과 달리 단일 순방향 패스를 통해 결과를 생성하며 처리 속도를 높였습니다.

팩트젠셉션은 깊이 추정, 세그멘테이션, 3D 포즈 추정 등 다양한 컴퓨터 비전 작업을 수행합니다. 모델은 모든 출력 결과를 표준 3채널 RGB 이미지로 변환하여 단일 아키텍처로 여러 기능을 구현합니다.

팩트학습 데이터는 7,500개의 합성 비디오로 구성되었습니다. 이는 기존 모델들이 사용하는 수백만 개의 비디오와 비교해 7배에서 500배 적은 양입니다.

팩트젠셉션은 적은 데이터로도 뎁스 애니띵3나 메타의 샘3와 같은 전문 모델과 대등하거나 더 나은 성능을 기록했습니다. 훈련 과정에서는 800개의 디지털 휴먼 모델과 200개의 모션 시퀀스를 블렌더로 렌더링하여 사용했습니다.

팩트실제 비디오 데이터는 언어 기반 세그멘테이션 작업에만 제한적으로 활용되었습니다. 모델의 처리 속도는 여전히 개선이 필요한 과제로 남아 있습니다. 81프레임 비디오를 처리하는 데 작은 모델은 약 6초, 140억 개의 파라미터를 가진 큰 모델은 약 10초가 소요됩니다.

주장연구진은 비디오 생성 모델이 단순히 엔터테인먼트 도구를 넘어 이미지 처리 분야에서 대규모 언어 모델과 같은 역할을 할 수 있다고 강조합니다. 젠셉션은 비디오 생성 능력을 활용해 특정 비전 작업에서 전문 시스템보다 우수한 특징을 추출합니다.

교차검증비디오 생성 모델이 진정한 세계 모델인지에 대해서는 학계의 논쟁이 존재합니다. 일부 연구자는 비디오 생성 모델이 실제 세계와의 상호작용 피드백이 부족하여 물리 법칙을 진정으로 이해하지 못한다고 지적합니다.

교차검증얀 르쿤 등 일부 전문가는 픽셀을 예측하는 생성형 비디오 모델이 한계가 명확한 막다른 길이라고 비판합니다. 칭화대학교의 벤치마크 결과에 따르면 소라와 같은 모델들도 기본적인 물리 법칙과 논리 테스트에서 반복적으로 실패하는 모습을 보였습니다.

주장비디오 생성 모델의 물리적 이해도에 대한 회의적 시각에도 불구하고 연구진은 시각적 데이터의 구조적 학습이 범용 모델로 나아가는 필수 과정임을 재확인합니다.

팩트젠셉션은 비디오 데이터의 효율적 활용 가능성을 입증하며 컴퓨터 비전 모델의 새로운 방향성을 제시했습니다.

출처더 디코더 및 아카이브 논문 자료를 교차 검증했습니다.

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

mistralai/mistral-commonv1.11.6

v1.11.6: 수정 및 문법 선택기 패치

이번 릴리즈에서는 오디오 청크 유효성 검사 시 ValidationError 대신 ValueError를 발생시키도록 수정되었습니다. 또한, 샘플링 속도가 프레임 속도보다 낮은 AudioConfig를 거부하고, SentencePiece에서 SpecialTokenPolicy.RAISE 시 일반 토큰을 디코딩하도록 변경되었습니다. 토크나이저에서 문법 변형을 자동 선택하고, SpeechRequest OpenAI 변환 시 시드 필드가 올바르게 처리되도록 수정되었습니다.

2일 전

OpenAIv2.46.0

2.46.0 (20260717) Full Changelog: v2.45.0...v2.46.0(https://github.com/openai/openaipython/compare/v2.45.0...v2.46.0)

3일 전

Anthropicv0.117.0

v0.117.0

이번 릴리즈에서는 dreaming 및 MCP Tunnels API 지원이 추가되었습니다. 또한, SecretStr을 사용하여 traceback에서 credential 정보가 노출되지 않도록 수정되었으며, 문서 필드 설명 및 예제 업데이트가 포함되었습니다.

3일 전

LangChainlangchain==1.3.14

langchain==1.3.14

`ToolRetryMiddleware`에서 재시도 가능한 예외만 재시도하도록 수정되었습니다. 또한 `ToolErrorMiddleware` 기능이 추가되었습니다.

3일 전

Transformersv5.14.1

패치 릴리즈: v5.14.1

이번 패치 릴리즈는 Inkling 모델 통합 시 발생했던 몇 가지 문제를 해결했습니다. 특히 EncoderDecoderCache를 사용하는 모델의 assisted generation 관련 문제를 수정했습니다. 또한, position_bias를 사용하는 Inkling 모델에서 StaticCache 및 sdpa를 이용한 prefill 시 발생할 수 있는 문제를 해결했습니다.

4일 전

PAPERS