저도 비슷한 고민을 했는데 결국 text-embedding-3-small로 시작했어요. 비용이 워낙 저렴하거든요. 다만 한국어만 다루는 프로젝트라면 multilingual-e5나 ko-sroberta 같은 오픈소스가 정확도 면에서 더 좋더라고요.
핵심은 OP님 말씀처럼 도메인이 맞냐인데, 저는 벡터DB에 몇백 개 문서 올려놓고 실제 쿼리로 테스트해본 후 결정하는 게 제일 빠르더라고요. 모델마다 결과가 확실히 다니까요. 혹시 평가 지표는 뭘 보고 계세요?
핵심은 OP님 말씀처럼 도메인이 맞냐인데, 저는 벡터DB에 몇백 개 문서 올려놓고 실제 쿼리로 테스트해본 후 결정하는 게 제일 빠르더라고요. 모델마다 결과가 확실히 다니까요. 혹시 평가 지표는 뭘 보고 계세요?