MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 8월 3일 월요일

AI 시대, 당신을 더욱 스마트하게

AI검증

메타, 광고 추천 모델 GEM 학습 효율 2배 향상

메타가 광고 추천 모델인 GEM의 학습 효율을 기존 대비 2배 높였습니다. 하드웨어와 소프트웨어를 공동 설계하는 전략으로 대규모 연산 처리를 최적화했습니다.

2026년 8월 3일

주장메타는 광고 추천 모델인 GEM의 학습 효율을 극대화하고자 하드웨어와 소프트웨어를 공동 설계하는 전략을 도입했습니다. 기존 거대언어모델 전용 인프라가 추천 시스템의 특수한 데이터 구조를 처리하는 데 한계가 있다는 판단에서입니다.

팩트메타는 지난 12개월 동안 GEM 모델의 종단간 학습 효율을 20~25% 수준의 MFU로 2배 높였습니다. 이와 동시에 전체 학습 연산량인 FLOPs를 4배로 확장하는 성과를 거두었습니다.

팩트GEM 모델은 수조 개의 희소 임베딩 파라미터와 수십억 개의 밀집 파라미터를 포함하는 하이브리드 아키텍처를 기반으로 합니다. 이 모델은 사용자 활동 기록과 같은 시퀀스 데이터와 위치 정보 등 비시퀀스 데이터를 동시에 처리합니다.

교차검증추천 시스템은 거대언어모델과 달리 데이터 길이가 불규칙하고 상호작용 패턴이 비대칭적입니다. 일반적인 거대언어모델 최적화 기법을 그대로 적용하면 패딩으로 인한 연산 낭비가 최대 50%에 달하는 등 효율 저하 문제가 발생합니다.

팩트메타는 이러한 연산 효율 문제를 해결하기 위해 Jagged Flash Attention과 같은 맞춤형 커널 라이브러리를 개발했습니다. 또한 MXFP8과 같은 초저정밀도 학습 기법을 도입하여 최신 그래픽처리장치 아키텍처의 성능을 극대화했습니다.

주장메타는 확장성 문제를 해결하기 위해 토폴로지 인식 5D 병렬화 전략을 채택했습니다. 이는 통신 오버헤드를 줄이고 수천 개의 그래픽처리장치에서 학습을 효율적으로 분산시키기 위한 핵심 기술입니다.

팩트5D 병렬화는 2D FSDP와 전문가 병렬화를 결합하여 밀집 파라미터를 처리합니다. 희소 파라미터에 대해서는 완전히 샤딩된 2D 모델 병렬화를 적용하여 통신 효율을 높였습니다.

교차검증분산 학습 환경에서는 통신 시간이 연산 시간을 초과할 경우 성능이 급격히 하락합니다. 메타는 연산과 통신을 중첩하고 메모리 압박으로 인한 재연산을 최소화하여 선형적인 확장성을 확보했습니다.

팩트메타는 학습 효율을 측정하기 위해 종단간 MFU를 로컬 MFU와 확장 비율로 분해하는 프레임워크를 사용합니다. 이를 통해 커널 수준의 연산 최적화와 분산 시스템 수준의 확장성 문제를 분리하여 해결했습니다.

주장이번 성과는 추천 시스템의 복잡한 데이터 구조를 대규모 인프라에서 효율적으로 처리할 수 있음을 입증합니다. 메타는 향후에도 하드웨어와 소프트웨어의 긴밀한 통합을 통해 학습 성능을 지속적으로 개선할 계획입니다.

팩트메타가 개발한 5D 병렬화 전략은 대규모 분산 학습에서 발생하는 통신 병목 현상을 효과적으로 제어합니다. 이는 복잡한 하이브리드 아키텍처를 가진 모델의 학습 시간을 단축하는 데 기여합니다.

출처메타 엔지니어링 블로그(https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/)를 교차 검증했습니다.

주제

관련 콘텐츠

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

TensorRTv1.3.0rc23

v1.3.0rc23 릴리즈

이번 릴리즈에서는 DeepSeek V4 혼합 정밀도 NVFP4 체크포인트 로딩, Gemma4 K=V 레이어 W4A8 체크포인트 로딩 지원 등 모델 지원이 강화되었습니다. 또한, VisualGen 모델에 대한 비대칭 TP 선형 구현, 멀티 프로세스 HTTP 프론트엔드 지원 등 API 개선이 이루어졌습니다. GPT-OSS 및 GLM-5의 Python KV-캐시 트랜시버 기본값 설정, MiniMax-M3 MSA 희소 어텐션 백엔드 추가 등 다양한 기능이 추가되었으며, 여러 버그 수정 및 성능 최적화가 포함되었습니다.

3일 전

OpenAIv2.52.0

v2.52.0

이번 릴리즈에서는 API에 콘텐츠 출처 확인 기능이 추가되었습니다. 또한, 클라이언트에서 Retry-After 지연 시간을 최대 2분까지 지원하도록 수정되었으며, API 키 mTLS HTTP 클라이언트 레시피 관련 문서가 업데이트되었습니다.

3일 전

OpenAIv2.51.0

v2.51.0

이번 릴리즈에서는 API에 fast tier 기능이 추가되었습니다. 또한, 해당 fast tier 기능이 헬퍼 메서드에도 적용되었습니다.

4일 전

LangChainlangchain-core==1.5.3

langchain-core==1.5.3

langchain-core 1.5.3 릴리즈에서는 게이트웨이에서 `LANGSMITH_API_KEY`를 사용하도록 폴백(fallback)하는 수정 사항이 포함되었습니다.

4일 전

OpenAIv2.50.0

v2.50.0

이번 릴리즈에서는 API의 트랜스크립션 모델 업데이트가 포함되었습니다. 또한, 오디오 관련 버그 수정으로 트랜스크립션 키워드 오버로드가 복원되었습니다.

5일 전

PAPERS