LFM2.5-DSpark 추론 속도 최대 3.2배 향상
리퀴드 인공지능이 엘에프엠 2.5 모델군의 추론 속도를 높이는 디스파크 초안 모델 체크포인트를 공개했습니다. 이번 기술은 그래픽 처리 장치와 온디바이스 환경에서 처리량을 대폭 개선합니다. 허깅 페이스에서 사프텐서와 지지지유에프 형식으로 다운로드할 수 있습니다.
주장리퀴드 인공지능은 엘에프엠 2.5 모델군에 적용 가능한 디스파크 초안 모델 체크포인트를 공개했습니다.
팩트이번에 공개된 모델은 엘에프엠 2.5 1.2비 인스트럭트, 엘에프엠 2.5 2.6비, 엘에프엠 2.5 8비 에이원비 등 총 3종입니다.
팩트이 모델들은 추론 시 그래픽 처리 장치 환경에서 최대 3.18배, 온디바이스 환경에서 최대 2.87배의 처리량 개선을 달성했습니다.
팩트디스파크는 경량화된 초안 모델로 후보 토큰을 생성하고 타겟 모델이 이를 검증하는 추측적 디코딩 방식을 사용합니다.
팩트타겟 모델은 단일 순방향 패스로 모든 토큰을 검증하여 가중치 로딩 비용을 공유합니다.
팩트디스파크 기술은 디플래시 스타일의 병렬 백본, 토큰 간 의존성을 높이는 마르코프 체인 기반의 순차 헤드, 신뢰도 기반의 검증기로 구성됩니다.
팩트각 초안 모델은 약 3억 개의 파라미터로 구성됩니다.
교차검증엘에프엠 2.5 8비 에이원비 모델의 경우 온디바이스 환경에서 평균 18%의 속도 향상에 그쳤습니다.
팩트이는 라마 시피피의 메탈 백엔드에서 혼합 전문가 모델을 처리할 때 발생하는 가중치 트래픽 증가가 원인입니다.
팩트이번 업데이트로 함수 호출 지연 시간이 엘에프엠 2.5 2.6비 모델 기준 평균 57% 감소했습니다.
팩트디스파크는 라마 시피피 및 에스지랭크 프레임워크를 공식 지원합니다.
팩트사용자는 허깅 페이스에서 사프텐서 및 지지지유에프 형식으로 제공되는 체크포인트를 즉시 다운로드합니다.
주장추측적 디코딩 방식은 타겟 모델 분포와 일치하는 토큰만 수용하여 출력 품질 손실이 없습니다.
팩트엘에프엠 2.5 2.6비 모델은 엠포 맥스 맥북 프로 환경에서 초당 약 140토큰 이상의 처리량을 기록했습니다.
출처리퀴드 인공지능 공식 블로그(https://www.liquid.ai/blog/lfm25-dspark) 및 허깅 페이스 기술 문서를 교차 검증했습니다.
주제
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

