저도 비슷한 문제로 고민했는데, 임베딩 모델 바꾸는 것만으로는 한계가 있더라고요. 저는 쿼리 리라이팅을 먼저 시도해봤는데 생각보다 효과가 좋았습니다. 사용자 쿼리를 2~3개 변형해서 각각 검색한 후 재랭킹하는 식으로요.
그리고 하이브리드 방식에 RRF(Reciprocal Rank Fusion) 적용해보셨나요? 저희는 BM25랑 semantic search 결과를 단순히 섞는 것보다 RRF로 합치니까 precision이 꽤 올라갔습니다.
파인튜닝 임베딩이라면 BAAI의 bge-large-zh-v1.5나 최근 나온 voyage-3 같은 모델들이 평가에서 잘 나오는데, 데이터
그리고 하이브리드 방식에 RRF(Reciprocal Rank Fusion) 적용해보셨나요? 저희는 BM25랑 semantic search 결과를 단순히 섞는 것보다 RRF로 합치니까 precision이 꽤 올라갔습니다.
파인튜닝 임베딩이라면 BAAI의 bge-large-zh-v1.5나 최근 나온 voyage-3 같은 모델들이 평가에서 잘 나오는데, 데이터