최근에 ollama로 Llama 3.1 70B 받아서 로컬 머신에서 굴려봤는데 생각보다 괜찮더라고요. RTX 4090 한 장에서 돌리고 있는데 토큰 생성 속도가 생각한 것보다 빠릅니다. 이전 Llama 2 70B랑 비교하면 응답 품질이 눈에 띄게 올라갔어요.
특히 코드 생성이랑 논리적 추론 부분에서 개선이 많이 된 걸 느꼈습니다. 같은 프롬프트로 테스트해봤는데 Llama 3.1이 context window를 훨씬 잘 활용하더라고요. 128K tokens 지원하는 게 실제로 느껴진다는 뜻이죠. 긴 문서 분석할 때 이전보다 훨씬 정확하게 처리하는 게 눈에 띕니다.
다만 메모리 문제는 여전히 고민이네요. 4-bit quantization으로 줄여도 VRAM이 상당히 필요해서 그래픽카드 좋은 거 필수입니다. 일반 노트북으로는 못 쓸 수준이죠. 그리고 한국어 처리는 여전히 약한 것 같아요. English prompt로 주면 괜찮은데 한국어 들어가면 품질이 뚝 떨어집니다.
혹시 로컬에서 오픈소스 모델 쓰고 계신 분 계신가요? 더 가벼운 대안이나 한국어 처리 잘 하는 다른 모델 있으면 추천 받고 싶습니다. 특히 비용 없이 프라이빗하게 쓸 수 있는 거 말이죠.