2026.09.23 접속자 41
로그인 회원가입
HOT
[프롬프트] 코드 리뷰 프롬프트 효과본 누계 있으세요? [AI뉴스] 한국 AI 기본법 시행됐는데 회사에서 뭘 준비해야 하나요? [AI뉴스] 최근 LLM 모델들 정리해봤는데 진짜 미친 속도로 늘어나네요 [기술 Q&A] 최신 LLM들의 컨텍스트 윈도우 비교해보니 생각보다 차이 크네요 [AI뉴스] GPT-6 Astra 나왔다는데 동시에 ChatGPT 먹통? 이게 뭐하는 짓인지 모르겠네요 [자유게시판] 편의점 샐러드 요즘 괜찮던데 한번 사먹어보세요 [AI뉴스] 요즘 딥러닝 논문들 보니 진짜 방향이 바뀌고 있네요 [AI뉴스] 최근 LLM 출시 물량 정말 많네요.. 이 정도면 너무 많은 거 아닌가요? [프롬프트] 클로드한테 물어볼 때 이 프롬프트 쓰니까 훨씬 낫더라고요 [기술 Q&A] Llama 3.1 405B 로컬에서 돌려봤는데 생각보다네요 [프롬프트] 코드 리뷰 프롬프트 효과본 누계 있으세요? [AI뉴스] 한국 AI 기본법 시행됐는데 회사에서 뭘 준비해야 하나요? [AI뉴스] 최근 LLM 모델들 정리해봤는데 진짜 미친 속도로 늘어나네요 [기술 Q&A] 최신 LLM들의 컨텍스트 윈도우 비교해보니 생각보다 차이 크네요 [AI뉴스] GPT-6 Astra 나왔다는데 동시에 ChatGPT 먹통? 이게 뭐하는 짓인지 모르겠네요 [자유게시판] 편의점 샐러드 요즘 괜찮던데 한번 사먹어보세요 [AI뉴스] 요즘 딥러닝 논문들 보니 진짜 방향이 바뀌고 있네요 [AI뉴스] 최근 LLM 출시 물량 정말 많네요.. 이 정도면 너무 많은 거 아닌가요? [프롬프트] 클로드한테 물어볼 때 이 프롬프트 쓰니까 훨씬 낫더라고요 [기술 Q&A] Llama 3.1 405B 로컬에서 돌려봤는데 생각보다네요
프롬프트

LLM 로컬 배포 해본 사람 있나요? 생각보다 까다로운데

코드리뷰어 2026.08.26 19:52 조회 148 추천 10 댓글 2건
회사 프로젝트에서 데이터 보안 때문에 클라우드 API 못 쓰고 온프레미스에 LLM을 직접 배포해야 했거든요. Ollama랑 LM Studio 써봤는데 둘 다 생각보다 번거로운 거 있더라고요. 특히 토큰 처리 부분에서 예상 안 했던 메모리 이슈가 자주 터졌어요.

결국 vLLM으로 갈아탔는데 inference 속도가 정말 달라요. 같은 모델이어도 처리 속도가 1.5배 이상 빨라졌습니다. 근데 세팅이 좀 복잡하긴 해서 초반에 시간이 꽤 걸렸어요.

혹시 비슷한 환경에서 작업하시는 분들은 어떤 솔루션 쓰고 계세요? 더 나은 방법이 있으면 참고하고 싶네요.
추천 10 비추천 0
댓글 2

댓글목록

profile_image
딥러닝장인
vLLM 정말 체감되는 차이 있더라고요. 저도 비슷한 상황인데 메모리 최적화가 핵심인 것 같아요.
profile_image
딥러너
vLLM 선택 잘하셨네요. 저도 비슷한 상황에서 Ollama 쓰다가 batch 처리할 때 메모리 폭증하는 거 경험했거든요. vLLM의 paged attention이 진짜 차이를 만드는 것 같아요.
한 가지 팁인데 vLLM 세팅할 때 tensor-parallelism 설정이 까다로울 수 있으니 GPU 메모리 구성에 맞게 --gpu-memory-utilization 파라미터를 조정하시면 도움이 됩니다. 저는 0.8~0.9 사이에서 가장 안정적이었어요.
혹시 serving 레이어로는 뭘 쓰고 계세요? FastAPI로 래핑해서 쓰는지, 아니면 vLLM의 기본 API 서버를 그대로 쓰는지 궁금하네요.