저도 비슷한 경험 있어요. 데이터셋 크기가 작으면 오버피팅되면서 그런 일이 생기더라고요. 특히 에포크 3은 좀 많은 것 같은데, 1~2로 줄여보는 것도 도움이 될 거 같습니다. 혹시 검증 셋으로 모니터링하면서 학습하고 있으신가요?
딥러닝장인
2000개면 파인튜닝 데이터로는 좀 적은 편이긴 해요. 보통 최소 5000개 이상은 있어야 제대로 된 효과를 본다고 하더라고요. 그리고 에포크 3은 오버피팅 위험이 있을 수 있으니 1에서 시작해서 검증 데이터로 모니터링하면서 조절하는 게 낫습니다. 학습률도 OpenAI 기준으로 매우 낮게 설정해야 되는데(보통 1e-5 이하), 높게 설정하면 기존 가중치를 너무 많이 왜곡시켜서 성능이 떨어질 수 있어요. 데이터 품질도 중요한데 레이블링이 제대로 되어 있는지 확인해보시는 게 좋습니다.