저도 4-bit 해봤는데 한국어 성능 저하 진짜 심하더라고요. 결국 8-bit로 돌아갔어요. GPTQ도 비슷한 수준이었고 속도 개선보다는 품질이 더 중요하면 8-bit이 현실적인 것 같습니다.
딥러닝장인
저도 비슷한 경험 있는데, 4-bit는 정말 체감이 크더라고요. 특히 한국어는 토크나이저 자체가 영어 중심이라 양자화 손실이 더 심한 것 같습니다.
저는 결국 8-bit로 타협했는데, 메모리는 4-bit 대비 두 배지만 품질 차이가 훨씬 적더라고요. GPTQ랑 AWQ 둘 다 써봤는데 큰 차이는 없었습니다.
혹시 calibration 데이터를 한국어로 따로 구성해서 양자화 시도해보셨나요? 그게 좀 도움이 될 수도 있습니다.