엣지 디바이스용 시각-언어 모델 LFM2.5-VL-3B 공개
리퀴드AI는 엣지 디바이스에서 구동되는 시각-언어 모델 LFM2.5-VL-3B를 출시했습니다. 이 모델은 3.1B 파라미터 규모와 확장된 어휘 사전을 바탕으로 실시간 응답 속도를 높였습니다. 주요 추론 생태계를 지원하며 온디바이스 환경에서 효율적인 성능을 발휘합니다.
주장리퀴드AI는 엣지 디바이스에서 구동하는 시각-언어 모델인 LFM2.5-VL-3B를 출시했습니다. 이 모델은 복잡한 추론 과정 없이 직접 답변을 생성하여 실시간 응답 속도를 극대화합니다.
주장실시간 응답 속도를 극대화한 이 모델은 화면 및 사용자 인터페이스(UI) 이해, 객체 탐지, 다중 이미지 입력 처리, 도구 호출 등 네 가지 영역에서 성능이 향상됐습니다. 특히 디지털 화면의 사용자 인터페이스 요소를 읽고 이해하는 능력이 강화됐습니다.
팩트향상된 능력을 갖춘 LFM2.5-VL-3B는 3.1B 파라미터 규모의 모델로, SigLIP2 400M NaFlex 비전 인코더와 LFM2.5-2.6B 텍스트 모델 백본을 결합했습니다. 학습에는 약 34T 토큰이 사용됐으며, 이전 버전 대비 4배 많은 시각 데이터를 학습했습니다.
팩트이전 버전 대비 4배 많은 시각 데이터를 학습한 이 모델은 어휘 사전을 확장하여 비라틴 문자를 지원합니다. 모델의 어휘 사전은 기존 토크나이저를 확장하여 128K로 두 배 늘어났으며, 사후 학습은 지도 미세 조정과 다중 보상 강화 학습의 두 단계로 진행됐습니다.
팩트두 단계로 진행된 사후 학습을 거친 모델은 추론 속도 측면에서 엠파이브 맥스(M5 Max) 칩셋 기준 초당 228 토큰, 갤럭시 에스 스물여섯(Galaxy S26) 울트라에서 초당 20 토큰의 속도를 기록했습니다. 그래픽 처리 장치(GPU) 환경에서는 고동시성 환경에서 초당 약 1만1000 토큰의 처리량을 보여 4B급 모델보다 2배 빠른 성능을 나타냈습니다.
팩트2배 빠른 성능을 나타낸 LFM2.5-VL-3B는 라마닷시피피(llama.cpp), 엠엘엑스(MLX), 브이엘엘엠(vLLM), 에스지랑(SGLang), 오엔엔엑스(ONNX) 등 주요 추론 생태계를 출시 당일부터 지원합니다. 이 모델은 약 3GB의 메모리 점유율로 온디바이스 환경에서 효율적인 구동이 가능합니다.
주장온디바이스 환경에서 효율적인 구동이 가능한 이 모델은 일상적인 캡션 생성, 시각적 질의응답, 문서 이해뿐만 아니라 도구 호출 기능이 대폭 강화되어 실무 활용도가 높습니다. 모델은 텍스트 전용 및 시각-텍스트 결합 상황 모두에서 안정적인 도구 사용 능력을 보입니다.
교차검증안정적인 도구 사용 능력을 보이는 모델에 대해 벤치마크 결과는 실시간 이미지 작업에서 동급 모델 대비 우수한 성능을 증명합니다. 그러나 특정 고난도 과학적 추론이나 복잡한 다중 이미지 분석에서는 모델 규모의 한계가 존재할 수 있습니다.
교차검증모델 규모의 한계가 존재할 수 있는 점과 관련하여 벤치마크 데이터는 브이엘엘엠 영점사십육점영(vLLM 0.26.0) 버전을 사용하여 정규화된 수치로 측정됐습니다. 실제 사용자 환경의 하드웨어 사양이나 프롬프트 설정에 따라 실제 체감 성능은 달라집니다.
출처하이픈 페이스(Hugging Face) 블로그 및 리퀴드AI 공식 기술 블로그 자료를 교차 검증했습니다.
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

