회사에서 문서 기반 Q&A 시스템 만들어야 해서 처음으로 로컬 LLM 가지고 RAG 구축해봤어요. Ollama로 Mistral 띄우고 LangChain 연결해서 하는 거였는데, 생각보다 괜찮더라고요.
CPU 기반이라 응답 속도는 느렸지만, 회사 기밀 문서를 외부 API로 보낼 필요가 없어서 보안 부분에서는 훨씬 깔끔했습니다. 벡터 DB는 Chroma 썼는데 가볍고 설정이 간단해서 좋았어요. 문제는 embedding 퀄리티인데, 무료 모델들이 생각보다 부정확할 때가 있다는 거네요.
GPT-4를 쓸 때만큼 퀄리티는 안 나오지만, 비용 대비로는 충분히 실용적이라고 생각합니다. 같은 거 고민 중인 분들 있으면 한 번 도전해볼 만한 것 같아요.