요즘 특정 도메인용 LLM을 파인튜닝하고 있는데, 학습 데이터 중에 컨텍스트가 긴 문서들이 많거든요. 모델의 토큰 길이 제한(예를 들어 4K)을 초과하는 데이터를 어떻게 처리해야 할지 고민입니다.
지금까지는 단순하게 자르거나 요약해서 넣었는데, 이렇게 하면 중요한 정보가 손실될 수 있어서 걱정이더라고요. 혹시 더 좋은 방법이 있을까요? 혹은 이런 상황에서는 애초에 토큰 길이가 긴 모델(8K, 32K 같은)을 쓰는 게 답인지도 모르겠네요.
실제로 이런 작업 해보신 분들이 계시면 어떤 접근 방식을 썼는지 궁금합니다.
추천 0 비추천 0