요즘 개인 프로젝트에서 올라마로 라마2 돌려보고 있는데 예상보다 괜찮더라고요. 물론 GPT-4와 비교하면 한참 밀리지만 단순 문서 요약이나 코드 리뷰 정도는 충분히 가능한 수준이네요. 응답 속도도 생각보다 빨아서 놀랐습니다.
다만 비용 문제는 완전히 해결되진 않네요. GPU 전기료가 생각보다 꽤 나가거든요. 그래도 API 비용보다는 훨씬 싸긴 한데 장기적으로 운영하려면 좀 더 최적화가 필요할 것 같습니다.
혹시 로컬 LLM으로 뭔가 프로젝트 진행 중인 분 계신가요? 어떤 모델 쓰시고 있는지, 실제로 프로덕션 환경에서는 어떤 식으로 운영하시는지 궁금합니다.
추천 0 비추천 0