저도 비슷한 작업 했는데 솔직히 토큰화 최적화보다는 데이터 선별이 훨씬 효과 있더라고요. 특히 품질 낮은 샘플들을 걸러내는 게 학습 시간도 줄고 결과도 좋았어요. 패킹 기법은 배치 효율은 올라가지만 토큰 수 자체를 줄이진 못하니까요.
제 경우엔 도메인 관련성 점수로 상위 70% 정도만 선별해서 썼는데, 전체 토큰은 70% 줄었어도 모델 성능은 거의 안 떨어졌거든요. 시간 있으면 한번 시도해보세요.
제 경우엔 도메인 관련성 점수로 상위 70% 정도만 선별해서 썼는데, 전체 토큰은 70% 줄었어도 모델 성능은 거의 안 떨어졌거든요. 시간 있으면 한번 시도해보세요.