엔비디아, 잭스 기반 드롭리스 에이치아이 학습 가속화
엔비디아가 잭스와 트랜스포머 엔진을 결합하여 대규모 언어 모델 학습 성능을 대폭 향상했습니다. 드롭리스 전문가 혼합 기술을 적용하여 토큰 손실 문제를 해결하고 연산 효율을 극대화했습니다.
주장엔비디아는 트랜스포머 엔진과 잭스를 결합하여 대규모 언어 모델의 핵심인 전문가 혼합 학습 효율을 개선합니다. 기존의 용량 기반 전문가 혼합 방식이 가진 토큰 손실이나 패딩으로 인한 자원 낭비 문제를 드롭리스 전문가 혼합 기술로 해결합니다.
팩트엔비디아 지비이백 시스템에서 딥시크 부이쓰리 모델을 학습시킨 결과, 기존 103 테라플롭스였던 성능이 1068 테라플롭스로 약 10.4배 향상했습니다.
팩트성능 향상은 트랜스포머 엔진의 그룹화된 제엠엠 커널이 가변적인 토큰 수를 단일 호출로 처리할 수 있게 된 결과입니다.
교차검증기존 전문가 혼합 학습은 라우터가 특정 전문가에게 토큰을 편중시키는 현상 때문에 연산 불균형이 발생했습니다. 라이브러리는 고정된 형태의 텐서 연산에 최적화되어 있어 가변적인 토큰 처리에 한계가 있었습니다.
팩트드롭리스 전문가 혼합은 모든 토큰을 선택된 전문가에게 전달하여 처리함으로써 모델의 품질을 보존합니다.
팩트기존 용량 기반 방식은 전문가별 토큰 할당량을 고정하여 오버플로우 토큰을 삭제하거나 패딩을 추가해야 하는 제약이 있었습니다.
주장트랜스포머 엔진은 그룹화된 제엠엠 커널을 통해 전문가별로 다른 토큰 수를 효율적으로 처리합니다.
팩트트랜스포머 엔진은 중앙처리장치와 그래픽 처리 장치 간의 불필요한 데이터 전송을 줄이고 쿠다 그래프를 유지하여 연산 지연 시간을 최소화합니다.
팩트엔시씨엘 이피 기술은 토큰의 분산 및 결합 단계를 통합하고 중복 토큰을 제거합니다.
팩트이 과정은 네트워크 트래픽을 감소시키며 대규모 그래픽 처리 장치 클러스터에서의 통신 병목 현상을 완화합니다.
교차검증대규모 모델 학습 시 통신 오버헤드는 전체 커널 시간의 84퍼센트를 차지할 정도로 큰 비중을 차지합니다.
팩트엔비디아는 잭스 호스트 오프로딩과 엑스엘에이 멀티스트리밍 기술을 도입하여 엔비링크 및 인피니밴드 패브릭 간의 통신을 최적화합니다.
팩트엔비디아 지비삼백 엔브이엘칠이 하드웨어 환경에서 1024개의 그래픽 처리 장치를 사용하여 딥시크 부이쓰리 671비 모델을 학습할 때 97퍼센트의 확장 효율을 달성했습니다.
주장이번 기술적 성과는 대규모 인공지능 모델 학습에서 발생하는 불규칙한 데이터 구조 문제를 해결한 데 의의가 있습니다. 전문화된 커널을 통해 하드웨어 가속기를 최대한 활용함으로써 학습 시간과 비용을 단축합니다.
출처NVIDIA Technical Blog(https://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/)의 보도를 교차 검증했습니다.
주제
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

