요즘 클라우드 API 비용이 미치도록 올라가서 로컬로 돌릴 수 있는 모델들 좀 찾아봤어요. 8GB 그래픽카드에 Llama 2 7B를 Ollama로 돌려봤는데 생각보다 괜찮더라고요. 물론 GPT-4 수준은 아니지만 코드 리뷰나 문서 작성 같은 작업은 충분히 해줍니다.
다만 첫 응답까지 걸리는 시간이 조금 길긴 해요. 배치 크기를 줄이니까 좀 나아졌는데 여전히 몇 초는 걸립니다. 그리고 VRAM 관리를 제대로 안 하면 OOM이 뜨니까 그 부분만 신경 쓰면 될 것 같아요.
혹시 같은 환경에서 더 최적화된 세팅 써보신 분 계신가요? quantized 모델 추천도 받고 싶습니다.
추천 0 비추천 0