요즘 자사 데이터로 LLM을 파인튜닝하려고 하는데 문제가 생겼네요. 학습 데이터 중에 컨텍스트가 꽤 긴 문서들이 많거든요. 근데 모델의 토큰 제한(대부분 4K~8K)에 걸려서 데이터를 자르거나 버려야 하는 상황이 계속 생기더라고요.
혹시 이런 경우 어떻게 대처하시나요? 그냥 자르고 학습하는 게 베스트인지, 아니면 롱컨텍스트 모델(Llama 2 Long 같은)로 갈아타는 게 낫는지 고민 중입니다. 비용도 고려해야 되고 학습 시간도 늘어날 것 같아서요.
혹시 이 과정에서 데이터 손실 없이 처리하신 경험 있으신 분 있으면 팁 공유 부탁드려요.
추천 0 비추천 0