전 보통 긴 문맥은 sliding window로 겹쳐서 청킹하더라고요. 정보 손실을 줄일 수 있거든요. 다만 VRAM이 24GB면 context length를 늘리기보다는 batch size 줄여서 4096 정도로 유지하는 게 낫지 않을까 싶아요. RoPE 스케일링도 고려해볼 만하고요. 실제로 Llama 2를 8192까지 파인튜닝한 결과들 보면 perplexity 차이가 크지 않더라고요.
궁금하면
저도 같은 문제로 고민했는데, 결국 sliding window로 오버래핑하면서 청킹하는 게 제일 낫더라고요. 정보 손실도 적고 학습 샘플도 늘어나니까요.