엔비디아 기밀 컴퓨팅을 통한 고성능 인공지능 추론 구현
엔비디아는 기밀 가상 머신과 암호화된 그래픽 처리 장치를 결합하여 보안 환경에서 인공지능 추론 성능 손실을 5퍼센트 미만으로 유지합니다. 성능 엔지니어링 팀은 8개의 비이백 그래픽 처리 장치를 사용한 테스트를 통해 데이터 처리량과 지연 시간을 검증했습니다. 기업은 보안 구성과 최적화를 동시에 수행하는 전방위적인 엔지니어링 접근을 추진해야 합니다.
주장대규모 언어 모델의 활용이 늘어남에 따라 기업은 민감한 정보를 보호하기 위한 신뢰할 수 있는 컴퓨팅 환경을 구축합니다. 엔비디아는 기밀 가상 머신과 암호화된 그래픽 처리 장치를 활용하여 보안이 강화된 환경에서도 고성능 인공지능 추론을 가능하게 합니다.
팩트엔비디아 기밀 컴퓨팅은 메모리 암호화 가상 머신, 기밀 그래픽 처리 장치, 그리고 암호화된 엔비디아 엔브이링크를 결합하여 하드웨어 수준에서 데이터를 보호합니다. 이 기술은 데이터가 처리되는 동안 외부의 접근으로부터 모델과 프롬프트를 안전하게 격리합니다.
교차검증기밀 컴퓨팅 환경에서는 메모리 이동, 타이밍, 스케줄링 및 다중 그래픽 처리 장치 통신 방식이 일반 환경과 달라 성능 오버헤드가 발생할 수 있습니다. 이를 해결하기 위해서는 추론 프레임워크와 기밀 컴퓨팅 환경이 상호 최적화되어야 합니다.
팩트엔비디아 성능 엔지니어링 팀은 8개의 비이백 그래픽 처리 장치를 사용하여 딥시크-알원 모델로 테스트를 진행했습니다. 테스트 결과, 기밀 컴퓨팅을 활성화했을 때 출력 토큰 처리량은 비활성화 대비 96.1퍼센트에서 98.2퍼센트 수준을 유지했습니다.
팩트토큰당 평균 지연 시간 오버헤드는 기밀 컴퓨팅 활성화 시 비활성화 대비 1.2퍼센트에서 4.3퍼센트 사이로 나타났습니다. 이는 보안을 강화하면서도 성능 손실을 5퍼센트 미만으로 억제했음을 증명합니다.
주장기밀 컴퓨팅 환경에서 성능을 유지하려면 호스트와 장치 간의 데이터 이동 방식을 조정해야 합니다. 엔비디아는 텐서알티 엘엘엠에서 페이지 가능한 메모리를 선택적으로 사용하고, 비동기 작업자를 활용하여 데이터 복사가 메인 스케줄러를 차단하지 않도록 최적화했습니다.
주장커널 자동 튜너의 타이밍 안정성을 확보하기 위해 그래픽 처리 장치 글로벌 타이머를 활용하는 방식이 도입되었습니다. 기존의 쿠다 이벤트 기반 측정은 기밀 컴퓨팅 환경에서 불안정한 신호를 보일 수 있으므로, 이를 대체하여 정확한 전술 선택을 가능하게 합니다.
교차검증기밀 컴퓨팅 환경에서는 엔브이엘에스 멀티캐스트 기능을 사용할 수 없으므로 통신 알고리즘의 변경이 필요합니다. 프레임워크는 엔브이엘에스 가용성을 감지하고 메시지 크기와 토폴로지에 최적화된 통신 방식을 선택해야 성능 저하를 방지할 수 있습니다.
주장인공지능 플랫폼 엔지니어는 보안 구성과 추론 최적화를 별개의 작업이 아닌 하나의 배포 문제로 다룹니다. 기밀 컴퓨팅 환경을 활성화하고 실제 운영할 워크로드를 사용하여 성능을 벤치마킹하는 전방위적인 엔지니어링 노력이 필요합니다.
출처엔비디아 기술 블로그(https://developer.nvidia.com/blog/enabling-private-high-performance-production-ai-inference-with-nvidia-confidential-computing/)의 내용을 교차 검증했습니다.
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

