요즘 개인 프로젝트로 llama2를 우리 회사 도메인에 맞게 파인튜닝하려고 하는데 GPT 수준은 아니더라도 준수한 수준으로 만들고 싶거든요. 근데 GPU 메모리 제약이 있어서 고민이 생겼어요.
LoRA는 파라미터 수는 적으면서도 효과가 좋다고 알고 있는데, QLoRA는 여기에 양자화까지 더해서 더 효율적이라고 하더라고요. 근데 양자화 때문에 성능 손실이 좀 있을 거 같은데 실제는 어떤지 궁금해요. A100이나 H100 같은 고사양 GPU가 아니라 RTX 4090으로 충분할까요?