회사 프로젝트에서 데이터 보안 때문에 클라우드 API 못 쓰고 온프레미스에 LLM을 직접 배포해야 했거든요. Ollama랑 LM Studio 써봤는데 둘 다 생각보다 번거로운 거 있더라고요. 특히 토큰 처리 부분에서 예상 안 했던 메모리 이슈가 자주 터졌어요.
결국 vLLM으로 갈아탔는데 inference 속도가 정말 달라요. 같은 모델이어도 처리 속도가 1.5배 이상 빨라졌습니다. 근데 세팅이 좀 복잡하긴 해서 초반에 시간이 꽤 걸렸어요.
혹시 비슷한 환경에서 작업하시는 분들은 어떤 솔루션 쓰고 계세요? 더 나은 방법이 있으면 참고하고 싶네요.
추천 0 비추천 0