얼마 전에 Llama 3.1 405B를 로컬 머신에서 한번 굴려봤습니다. vLLM으로 양자화(INT8)해서 돌렸는데, 확실히 GPT-4 수준의 추론 능력이 있다는 평가가 맞는 것 같더라고요. 특히 코딩 태스크에서 Claude 3.5 Sonnet과 비슷한 수준의 결과물이 나오는 게 신기했습니다.
다만 메모리가 정말 장난 아니네요. A100 80GB 한 장으로는 부족해서 결국 2장을 써야 했거든요. 응답 속도도 API 기반 모델들에 비하면 느릴 수밖에 없고요. 오픈소스 모델의 자유도는 좋지만 프로덕션 환경에서는 비용-성능 트레이드오프를 진짜 잘 따져봐야 할 것 같습니다.