벡터 검색 인덱스 하나로 메모리 줄여…검색 품질은 일부 희생
벡터 검색용 압축 인덱스를 하나만 보관하면서 코드 길이와 임베딩 차원을 조절하는 연구가 공개됐다. 두 자료군의 저자 실험에서 메모리 사용량은 줄었지만, 고품질 비교 기법보다 검색 순위 성적은 낮았다.

아틀라시안과 국립타이완대 연구진이 2일 공개한 사전공개 논문에서 벡터 검색용 인덱스 하나로 여러 압축률과 임베딩 차원을 지원하는 방법을 제안했다. 연구진의 실험에선 비교 대상보다 보관해야 할 데이터와 모델 매개변수의 메모리 총량이 적었지만, 검색 결과의 순위를 매기는 정확도에는 손실이 있었다.
하나의 코드에서 길이·차원 조절
벡터 검색은 문서 내용을 숫자 배열인 임베딩으로 바꿔 질의와 가까운 문서를 찾는 방식이다. 생성형 AI가 외부 문서를 찾아 답변할 때도 쓰인다. 저장량을 줄이려고 임베딩을 압축하면 검색 품질과 메모리 사이에서 선택해야 한다.
연구진의 MRVQ는 이미 만들어진 임베딩을 단계적으로 압축한다. 뒤쪽 압축 단계를 떼면 문서당 저장하는 코드가 짧아지고, 임베딩 좌표의 뒷부분을 제외하면 검색에 쓰는 차원이 줄어든다. 별도 인덱스를 각각 두지 않고 하나의 최대 길이 코드를 재사용하는 설계다.
연구진은 FiQA 문서 5만7638건·질의 648건과 NFCorpus 문서 3633건·질의 323건을 사용했다. 네 종류의 임베딩 계열에서 문서당 4·8·16바이트의 압축 코드를 비교했다. 이 자료군과 설정에서 MRVQ의 산정 메모리는 12.06~16.88MiB였다.
낮은 메모리와 순위 품질의 맞교환
연구진 계산에 따르면 MRVQ는 압축률마다 따로 학습한 QINCo2 인덱스 세 개보다 메모리 총량이 17.8~22.0배 적었다. 다만 FiQA에서 QINCo2의 nDCG@10 점수는 MRVQ보다 0.026~0.107 높았다. nDCG@10은 상위 10개 검색 결과의 관련성과 순서를 반영한 지표다. QINCo2는 별도 연구진이 발표한 신경망 기반 벡터 압축 기법이다.
이 수치는 실제 서버 프로세스의 사용량이 아니라 저장 코드와 모델 매개변수의 바이트를 합산한 결과다. 연구진은 검색 전체의 지연시간이나 처리량을 재지 않았다. 시험 자료군도 두 개로 제한돼 대규모 서비스에서 같은 배수의 절감이 유지된다고 단정할 수 없다. 이번 비교는 연구진 내부 실험이며 독립 재현 결과가 아니다.
대표 이미지: AI 생성 이미지 / 데이마크
자료: https://arxiv.org/abs/2610.03651
자료: https://arxiv.org/html/2610.03651
자료: https://arxiv.org/abs/2501.03078


