2026.09.16 접속자 237
로그인 회원가입
HOT
[AI뉴스] 요즘 생성형 AI 기술 이 정도까지 왔다네요... 뭐 하실 계획? [프롬프트] 프롬프트 작성할 때 맥락 정보는 얼마나 자세히 줘야 하나요? [프롬프트] 마케팅 카피 쓸 때 써먹는 프롬프트 공유합니다 [프롬프트] Claude 프롬프트로 장문 분석 자동화하는 방법 공유합니다 [AI뉴스] 생성형 AI 이제 그냥 기술이 아니라 사회 기반시설이 되고 있네요 [프롬프트] 코드 리뷰 프롬프트 공유합니다 (실제로 쓰는 거) [AI뉴스] 2026년 AI 산업 이제 정말 실전 단계네요 ㅎㅎ [AI뉴스] 요즘 AI 트렌드 생성형에서 에이전트로 넘어간다더라고요 [AI뉴스] 뤼튼이 유니콘 됐네요, 시리즈C에 1000억 투자 유치 [프롬프트] 업무 효율 2배로 올린 프롬프트 패턴 공유합니다 [AI뉴스] 요즘 생성형 AI 기술 이 정도까지 왔다네요... 뭐 하실 계획? [프롬프트] 프롬프트 작성할 때 맥락 정보는 얼마나 자세히 줘야 하나요? [프롬프트] 마케팅 카피 쓸 때 써먹는 프롬프트 공유합니다 [프롬프트] Claude 프롬프트로 장문 분석 자동화하는 방법 공유합니다 [AI뉴스] 생성형 AI 이제 그냥 기술이 아니라 사회 기반시설이 되고 있네요 [프롬프트] 코드 리뷰 프롬프트 공유합니다 (실제로 쓰는 거) [AI뉴스] 2026년 AI 산업 이제 정말 실전 단계네요 ㅎㅎ [AI뉴스] 요즘 AI 트렌드 생성형에서 에이전트로 넘어간다더라고요 [AI뉴스] 뤼튼이 유니콘 됐네요, 시리즈C에 1000억 투자 유치 [프롬프트] 업무 효율 2배로 올린 프롬프트 패턴 공유합니다
프롬프트

LLM 로컬 배포 해본 사람 있나요? 생각보다 까다로운데

코드리뷰어 2026.08.26 19:52 조회 118 추천 7 댓글 2건
회사 프로젝트에서 데이터 보안 때문에 클라우드 API 못 쓰고 온프레미스에 LLM을 직접 배포해야 했거든요. Ollama랑 LM Studio 써봤는데 둘 다 생각보다 번거로운 거 있더라고요. 특히 토큰 처리 부분에서 예상 안 했던 메모리 이슈가 자주 터졌어요.

결국 vLLM으로 갈아탔는데 inference 속도가 정말 달라요. 같은 모델이어도 처리 속도가 1.5배 이상 빨라졌습니다. 근데 세팅이 좀 복잡하긴 해서 초반에 시간이 꽤 걸렸어요.

혹시 비슷한 환경에서 작업하시는 분들은 어떤 솔루션 쓰고 계세요? 더 나은 방법이 있으면 참고하고 싶네요.
추천 7 비추천 0
댓글 2

댓글목록

profile_image
딥러닝장인
vLLM 정말 체감되는 차이 있더라고요. 저도 비슷한 상황인데 메모리 최적화가 핵심인 것 같아요.
profile_image
딥러너
vLLM 선택 잘하셨네요. 저도 비슷한 상황에서 Ollama 쓰다가 batch 처리할 때 메모리 폭증하는 거 경험했거든요. vLLM의 paged attention이 진짜 차이를 만드는 것 같아요.
한 가지 팁인데 vLLM 세팅할 때 tensor-parallelism 설정이 까다로울 수 있으니 GPU 메모리 구성에 맞게 --gpu-memory-utilization 파라미터를 조정하시면 도움이 됩니다. 저는 0.8~0.9 사이에서 가장 안정적이었어요.
혹시 serving 레이어로는 뭘 쓰고 계세요? FastAPI로 래핑해서 쓰는지, 아니면 vLLM의 기본 API 서버를 그대로 쓰는지 궁금하네요.