MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 8월 3일 월요일

AI 시대, 당신을 더욱 스마트하게

AI검증

몰모모션: 언어 기반 3D 동작 예측 모델 공개

앨런 AI 연구소가 언어 기반 3D 동작 예측 모델 '몰모모션(MolMoMotion)'을 공개했습니다. 이 모델은 비디오 프레임, 3D 지점, 텍스트 설명을 기반으로 미래 움직임을 예측합니다. 로봇 제어 및 영상 생성 분야에 활용될 것으로 기대됩니다.

2026년 6월 17일

팩트앨런 AI 연구소는 언어 기반 3D 동작 예측 모델 '몰모모션(MolMoMotion)'을 공개했습니다. 이 모델은 기존 사후적 동작 인식 기술을 넘어 미래 움직임을 예측하는 데 초점을 맞춥니다.

주장몰모모션은 로봇이 물체를 정확하게 잡거나 영상 생성 모델이 물리적으로 타당한 다음 프레임을 만드는 데 필수적인 기술입니다. 이는 인공지능 분야의 중요한 진전을 의미합니다.

팩트몰모모션은 비디오 프레임, 물체의 3D 지점, 수행할 동작에 대한 텍스트 설명을 입력받아 향후 몇 초간의 3D 공간 내 이동 경로를 예측합니다. 이 모델은 기존 예측 방식보다 훨씬 강력한 성능을 보입니다.

교차검증동작 예측은 단순히 관찰하는 것보다 훨씬 어려운 작업입니다. 하지만 이 기술은 로봇 계획이나 제어 가능한 영상 생성 등 다양한 응용 분야에서 높은 활용 가치를 지닙니다.

팩트앨런 AI 연구소는 116만 개의 비디오에서 추출한 3D 포인트 궤적 데이터셋인 '몰모모션-1M'을 함께 공개했습니다. 또한 2,700개의 비디오 클립으로 구성된 인간 검증 벤치마크 '포인트모션벤치(PointMotionBench)'도 배포했습니다.

주장몰모모션은 동작을 물체에 부착된 3D 포인트로 표현하여 효율성을 극대화했습니다. 이 방식은 전체 영상을 렌더링하는 비용 없이도 물리적 움직임을 정확하게 포착할 수 있습니다.

팩트이 모델은 특정 카테고리에 얽매이지 않는 범용성을 가집니다.

팩트몰모모션은 카메라 시점 변화에도 일관된 3D 좌표를 유지합니다. 또한 로봇 정책이나 영상 생성 모델이 직접 사용할 수 있는 간결한 궤적 데이터를 제공합니다.

팩트몰모모션은 '몰모 2(MolMo 2)' 모델을 백본으로 사용하여 언어 지시와 이미지 내 물체 및 지점을 연결합니다. 모델은 단계별 좌표를 예측하는 자기회귀 방식과 연속적인 공간에서 움직임을 예측하는 흐름 매칭 방식으로 나뉩니다.

교차검증데이터셋 구축 과정에서 일반 비디오의 노이즈와 깊이 추정 오류가 발생할 수 있습니다. 연구진은 이를 해결하기 위해 일관성 있게 움직이지 않는 지점을 필터링하고 궤적을 평활화하는 자동화 파이프라인을 도입했습니다.

팩트몰모모션-1M 데이터셋은 736개의 동작 유형과 5,600개의 서로 다른 물체를 포함합니다. 이는 현재까지 공개된 동작 설명이 포함된 객체 기반 3D 포인트 궤적 데이터 중 가장 큰 규모입니다.

주장이처럼 방대한 데이터셋과 벤치마크는 향후 3D 동작 예측 연구의 발전을 가속화할 것으로 기대됩니다. 이는 연구자들이 더욱 정교하고 실제와 같은 인공지능 모델을 개발하는 데 중요한 기반을 제공합니다.

출처앨런 AI 연구소의 공식 블로그(https://huggingface.co/blog/allenai/molmomotion)와 연구 논문(https://allenai.org/papers/molmomotion)을 교차 검증했습니다.

관련 콘텐츠

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

TensorRTv1.3.0rc23

v1.3.0rc23 릴리즈

이번 릴리즈에서는 DeepSeek V4 혼합 정밀도 NVFP4 체크포인트 로딩, Gemma4 K=V 레이어 W4A8 체크포인트 로딩 지원 등 모델 지원이 강화되었습니다. 또한, VisualGen 모델에 대한 비대칭 TP 선형 구현, 멀티 프로세스 HTTP 프론트엔드 지원 등 API 개선이 이루어졌습니다. GPT-OSS 및 GLM-5의 Python KV-캐시 트랜시버 기본값 설정, MiniMax-M3 MSA 희소 어텐션 백엔드 추가 등 다양한 기능이 추가되었으며, 여러 버그 수정 및 성능 최적화가 포함되었습니다.

2일 전

OpenAIv2.52.0

v2.52.0

이번 릴리즈에서는 API에 콘텐츠 출처 확인 기능이 추가되었습니다. 또한, 클라이언트에서 Retry-After 지연 시간을 최대 2분까지 지원하도록 수정되었으며, API 키 mTLS HTTP 클라이언트 레시피 관련 문서가 업데이트되었습니다.

2일 전

OpenAIv2.51.0

v2.51.0

이번 릴리즈에서는 API에 fast tier 기능이 추가되었습니다. 또한, 해당 fast tier 기능이 헬퍼 메서드에도 적용되었습니다.

3일 전

LangChainlangchain-core==1.5.3

langchain-core==1.5.3

langchain-core 1.5.3 릴리즈에서는 게이트웨이에서 `LANGSMITH_API_KEY`를 사용하도록 폴백(fallback)하는 수정 사항이 포함되었습니다.

3일 전

OpenAIv2.50.0

v2.50.0

이번 릴리즈에서는 API의 트랜스크립션 모델 업데이트가 포함되었습니다. 또한, 오디오 관련 버그 수정으로 트랜스크립션 키워드 오버로드가 복원되었습니다.

5일 전

PAPERS