메타, 광고 추천 모델 GEM 학습 효율 2배 향상
메타가 광고 추천 모델인 GEM의 학습 효율을 기존 대비 2배 높였습니다. 하드웨어와 소프트웨어를 공동 설계하는 전략으로 대규모 연산 처리를 최적화했습니다.
주장메타는 광고 추천 모델인 GEM의 학습 효율을 극대화하고자 하드웨어와 소프트웨어를 공동 설계하는 전략을 도입했습니다. 기존 거대언어모델 전용 인프라가 추천 시스템의 특수한 데이터 구조를 처리하는 데 한계가 있다는 판단에서입니다.
팩트메타는 지난 12개월 동안 GEM 모델의 종단간 학습 효율을 20~25% 수준의 MFU로 2배 높였습니다. 이와 동시에 전체 학습 연산량인 FLOPs를 4배로 확장하는 성과를 거두었습니다.
팩트GEM 모델은 수조 개의 희소 임베딩 파라미터와 수십억 개의 밀집 파라미터를 포함하는 하이브리드 아키텍처를 기반으로 합니다. 이 모델은 사용자 활동 기록과 같은 시퀀스 데이터와 위치 정보 등 비시퀀스 데이터를 동시에 처리합니다.
교차검증추천 시스템은 거대언어모델과 달리 데이터 길이가 불규칙하고 상호작용 패턴이 비대칭적입니다. 일반적인 거대언어모델 최적화 기법을 그대로 적용하면 패딩으로 인한 연산 낭비가 최대 50%에 달하는 등 효율 저하 문제가 발생합니다.
팩트메타는 이러한 연산 효율 문제를 해결하기 위해 Jagged Flash Attention과 같은 맞춤형 커널 라이브러리를 개발했습니다. 또한 MXFP8과 같은 초저정밀도 학습 기법을 도입하여 최신 그래픽처리장치 아키텍처의 성능을 극대화했습니다.
주장메타는 확장성 문제를 해결하기 위해 토폴로지 인식 5D 병렬화 전략을 채택했습니다. 이는 통신 오버헤드를 줄이고 수천 개의 그래픽처리장치에서 학습을 효율적으로 분산시키기 위한 핵심 기술입니다.
팩트5D 병렬화는 2D FSDP와 전문가 병렬화를 결합하여 밀집 파라미터를 처리합니다. 희소 파라미터에 대해서는 완전히 샤딩된 2D 모델 병렬화를 적용하여 통신 효율을 높였습니다.
교차검증분산 학습 환경에서는 통신 시간이 연산 시간을 초과할 경우 성능이 급격히 하락합니다. 메타는 연산과 통신을 중첩하고 메모리 압박으로 인한 재연산을 최소화하여 선형적인 확장성을 확보했습니다.
팩트메타는 학습 효율을 측정하기 위해 종단간 MFU를 로컬 MFU와 확장 비율로 분해하는 프레임워크를 사용합니다. 이를 통해 커널 수준의 연산 최적화와 분산 시스템 수준의 확장성 문제를 분리하여 해결했습니다.
주장이번 성과는 추천 시스템의 복잡한 데이터 구조를 대규모 인프라에서 효율적으로 처리할 수 있음을 입증합니다. 메타는 향후에도 하드웨어와 소프트웨어의 긴밀한 통합을 통해 학습 성능을 지속적으로 개선할 계획입니다.
팩트메타가 개발한 5D 병렬화 전략은 대규모 분산 학습에서 발생하는 통신 병목 현상을 효과적으로 제어합니다. 이는 복잡한 하이브리드 아키텍처를 가진 모델의 학습 시간을 단축하는 데 기여합니다.
출처메타 엔지니어링 블로그(https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/)를 교차 검증했습니다.
주제
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

