저도 비슷한 셋업으로 Llama2 돌려보니까 정말 실용적이더라고요. 특히 코드 작업은 왠만해선 충분하다는 데 동감합니다. 다만 VRAM 관리는 정말 까다로운데, 저는 양자화 적용해서 7B 모델로 줄여서 돌리고 있어요. 4B 정도면 심지어 8GB VRAM도 가능하거든요.
한국어는 진짜 문제인데, 저도 파인튜닝된 eKo 같은 모델로 바꿈으로써 훨씬 나아졌습니다. 비용 절감 측면론 확실히 가치 있지만, 프로덕션이라면 응답 품질 검증하는 데 꽤 시간이 들 거 같아요. 팀이 수용할 수 있는 수준인지 체크가 중요하다고
한국어는 진짜 문제인데, 저도 파인튜닝된 eKo 같은 모델로 바꿈으로써 훨씬 나아졌습니다. 비용 절감 측면론 확실히 가치 있지만, 프로덕션이라면 응답 품질 검증하는 데 꽤 시간이 들 거 같아요. 팀이 수용할 수 있는 수준인지 체크가 중요하다고