Sentence Transformers v6.0의 다중 벡터 모델 도입과 검색 성능 향상
센스 트랜스포머스(Sentence Transformers) v6.0은 텍스트를 하나의 벡터로 압축하지 않고 토큰별로 유지하는 다중 벡터 모델을 도입하여 검색 성능을 높입니다. 이 버전은 지연 상호작용 방식을 적용해 검색 정확도를 유지하면서도 시각적 문서 검색 등 다양한 분야에서 활용됩니다. 저장 공간 증가 문제는 압축 기술을 통해 해결할 수 있습니다.
주장센스 트랜스포머스 v6.0은 기존의 단일 벡터 압축 방식이 가진 정보 손실 문제를 해결하기 위해 다중 벡터 모델을 도입합니다. 이 방식은 텍스트를 하나의 벡터로 압축하지 않고 토큰별로 벡터를 유지하여 검색 성능을 극대화합니다.
팩트기존의 밀집 임베딩 모델은 전체 텍스트를 384, 768, 1024 차원의 단일 벡터로 압축합니다. 반면 다중 벡터 모델은 각 토큰을 128차원의 벡터로 유지하며, 9개의 토큰으로 구성된 문서는 9x128 행렬로 표현됩니다.
주장앞서 언급한 토큰별 벡터 유지 방식은 지연 상호작용 방식을 사용하여 검색 시점에 쿼리와 문서 간의 상호작용을 수행합니다. 이 방식은 문서 인덱싱을 오프라인에서 미리 수행할 수 있게 하면서도, 검색 정확도를 크로스 인코더 수준으로 유지합니다.
팩트검색 점수 산출에는 맥스심(MaxSim) 연산자가 사용됩니다. 각 쿼리 토큰과 가장 유사한 문서 토큰의 유사도를 계산하고 이를 합산하여 최종 점수를 도출합니다.
주장맥스심 연산자를 활용하는 다중 벡터 모델은 시각적 문서 검색 분야에서 뛰어난 성능을 보입니다. 광학 문자 판독(OCR) 과정을 거치지 않고 텍스트 쿼리와 페이지 이미지를 직접 매칭하여 정보 검색의 효율성을 높입니다.
팩트센스 트랜스포머스 v6.0 업데이트를 통해 파이레이트(PyLate) 체크포인트, 스탠퍼드 자연어 처리(Stanford-NLP) 콜버트(ColBERT) 체크포인트, 그리고 콜팔이 엔진(colpali-engine) 모델을 즉시 로드하여 사용합니다. 사용자는 기존의 익숙한 응용 프로그램 인터페이스(API)를 그대로 활용합니다.
교차검증다중 벡터 모델은 검색 품질 향상이라는 이점이 있지만, 인덱스 크기가 크게 증가합니다. 4874개의 문서를 기준으로 일반적인 밀집 모델보다 약 42배 이상의 저장 공간이 필요합니다.
팩트인덱스 크기 문제는 압축 기술을 통해 완화할 수 있습니다. 플래이드(PLAID)와 같은 인덱싱 방식을 사용하면 60만8414개의 토큰 벡터를 약 92메가바이트(MB) 수준으로 압축하여 저장합니다.
교차검증앞서 살펴본 인덱스 문제 외에도, 다중 벡터 모델은 긴 문서일수록 더 많은 토큰 벡터를 생성하므로 메모리 관리와 인덱스 최적화가 필수적입니다. 토큰 풀링(Token Pooling)이나 검색 후 재순위화 기법을 통해 인덱스 부담을 줄입니다.
출처허깅 페이스(Hugging Face) 블로그(https://huggingface.co/blog/multi-vector-encoder)의 내용을 교차 검증했습니다.
주제
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

