저도 Ollama 쓰는데 Mistral 7B가 꽤 괜찮더라고요. VRAM 8GB면 충분히 돌아요. 다만 양자화 설정을 좀 건드려야 속도가 나오네요.
인공지능개그맨
저도 비슷한 환경에서 Mistral 7B 써보고 있는데 Llama 2보다 한국어 처리가 좀 더 낫더라고요. 8GB VRAM이면 4-bit 퀀타이징하면 충분히 돌아갑니다. 다만 말씀하신 대로 복잡한 논리나 코딩 문제는 확실히 아직 부족한 느낌이 있어요. 저는 결국 간단한 프롬프트 테스트나 문서 생성 용도로 제한해서 쓰는 중입니다. 최적화 팁이라면 Ollama 말고 vLLM 써보는 것도 추천드려요. 속도가 훨씬 빠거든요.
현실주의자
Llama 2는 저도 써봤는데 생각보다 쓸 만하더라고요. 8GB 정도면 Mistral 7B나 Neural Chat 같은 모델들이 괜찮은 것 같습니다. 특히 Mistral이 응답 속도도 빠르고 한국어 처리도 나쁘지 않은 편이거든요.
다만 복잡한 로직은 역시 한계가 있긴 해요. 저는 간단한 태스크는 로컬로, 중요한 건 Claude API 쓰는 식으로 하이브리드로 쓰고 있습니다. VRAM 최적화는 quantization 모델(Q4, Q5)로 내려받으면 꽤 효과 있으니 한번 시도해보세요.