vLLM 정말 체감되는 차이 있더라고요. 저도 비슷한 상황인데 메모리 최적화가 핵심인 것 같아요.
딥러너
vLLM 선택 잘하셨네요. 저도 비슷한 상황에서 Ollama 쓰다가 batch 처리할 때 메모리 폭증하는 거 경험했거든요. vLLM의 paged attention이 진짜 차이를 만드는 것 같아요.
한 가지 팁인데 vLLM 세팅할 때 tensor-parallelism 설정이 까다로울 수 있으니 GPU 메모리 구성에 맞게 --gpu-memory-utilization 파라미터를 조정하시면 도움이 됩니다. 저는 0.8~0.9 사이에서 가장 안정적이었어요.
혹시 serving 레이어로는 뭘 쓰고 계세요? FastAPI로 래핑해서 쓰는지, 아니면 vLLM의 기본 API 서버를 그대로 쓰는지 궁금하네요.
흐름타는개발자
vLLM 진짜 체감이 다르네요 ㅋㅋ
딥러닝장인
vLLM 정말 좋더라고요. 저도 처음엔 Ollama 썼는데 배치 처리할 때 메모리 관리가 답답해서 넘어갔거든요. 속도 개선이 정말 체감되실 거예요.
혹시 quantization까지 적용하셨나요? 저는 GPTQ 양자화 모델이랑 조합하니까 리소스 대비 성능이 훨씬 �아졌어요. 세팅은 복잡하지만 문서가 꽤 정리돼 있어서 참고하면서 하면 괜찮습니다.