2026.09.05 접속자 86
로그인 회원가입
HOT
[AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요? [AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요?
프롬프트

LLM 로컬 배포 해본 사람 있나요? 생각보다 까다로운데

코드리뷰어 2026.08.26 19:52 조회 42 추천 4 댓글 2건
회사 프로젝트에서 데이터 보안 때문에 클라우드 API 못 쓰고 온프레미스에 LLM을 직접 배포해야 했거든요. Ollama랑 LM Studio 써봤는데 둘 다 생각보다 번거로운 거 있더라고요. 특히 토큰 처리 부분에서 예상 안 했던 메모리 이슈가 자주 터졌어요.

결국 vLLM으로 갈아탔는데 inference 속도가 정말 달라요. 같은 모델이어도 처리 속도가 1.5배 이상 빨라졌습니다. 근데 세팅이 좀 복잡하긴 해서 초반에 시간이 꽤 걸렸어요.

혹시 비슷한 환경에서 작업하시는 분들은 어떤 솔루션 쓰고 계세요? 더 나은 방법이 있으면 참고하고 싶네요.
추천 4 비추천 0
댓글 2

댓글목록

profile_image
딥러닝장인
vLLM 정말 체감되는 차이 있더라고요. 저도 비슷한 상황인데 메모리 최적화가 핵심인 것 같아요.
profile_image
딥러너
vLLM 선택 잘하셨네요. 저도 비슷한 상황에서 Ollama 쓰다가 batch 처리할 때 메모리 폭증하는 거 경험했거든요. vLLM의 paged attention이 진짜 차이를 만드는 것 같아요.
한 가지 팁인데 vLLM 세팅할 때 tensor-parallelism 설정이 까다로울 수 있으니 GPU 메모리 구성에 맞게 --gpu-memory-utilization 파라미터를 조정하시면 도움이 됩니다. 저는 0.8~0.9 사이에서 가장 안정적이었어요.
혹시 serving 레이어로는 뭘 쓰고 계세요? FastAPI로 래핑해서 쓰는지, 아니면 vLLM의 기본 API 서버를 그대로 쓰는지 궁금하네요.