최근 프로젝트에서 자체 개발한 LLM 기반 챗봇을 평가할 방법을 고민하고 있는데, 좋은 도구가 있으면 추천받고 싶어요. 지금까지는 주로 GPT-4로 수동 평가를 하거나 간단한 정확도 지표만 봤는데 더 체계적으로 하고 싶거든요.
현재 고려 중인 게 RAGAS인데, 실제로 프로덕션 환경에서 써보신 분 계신가요? RAG 시스템 평가할 때 정말 실용적인지 궁금합니다. 그리고 응답 품질 평가할 때 토큰 비용이 얼마나 들어가는지도 알고 싶고요.
또 다른 옵션으로 DeepEval이나 Evalaute 같은 도구들도 있던데, 각각 장단점이 뭔지 알 수 있을까요? 우리 팀은 한국 데이터 기반이라 한국어 평가가 제대로 되는지도 중요한데 이 부분에서 문제 있으신 분 있으셨으면 말씀해주세요.
비용과 정확성, 한국어 지원을 모두 고려해야 하는데 뭔가 트레이드오프가 심한 것 같아요. 혹시 자체 평가 파이프라인을 구축하신 분들도 있으면 어떻게 접근하셨는지 얘기해주면 감사하겠습니다.
추천 1 비추천 0