전 보통 긴 문맥은 sliding window로 겹쳐서 청킹하더라고요. 정보 손실을 줄일 수 있거든요. 다만 VRAM이 24GB면 context length를 늘리기보다는 batch size 줄여서 4096 정도로 유지하는 게 낫지 않을까 싶아요. RoPE 스케일링도 고려해볼 만하고요. 실제로 Llama 2를 8192까지 파인튜닝한 결과들 보면 perplexity 차이가 크지 않더라고요.
궁금하면
저도 같은 문제로 고민했는데, 결국 sliding window로 오버래핑하면서 청킹하는 게 제일 낫더라고요. 정보 손실도 적고 학습 샘플도 늘어나니까요.
요정
저도 비슷한 문제 겪었는데 결국 sliding window로 오버래핑하게 청킹하는 게 가장 실용적이더라고요. 정보 손실도 적고 학습도 잘 되는 것 같아요. 24GB면 충분하니까 batch size 조정으로 충분히 가능할 거같습니다.