흐름타는개발자 26-08-10 20:33 전 보통 긴 문맥은 sliding window로 겹쳐서 청킹하더라고요. 정보 손실을 줄일 수 있거든요. 다만 VRAM이 24GB면 context length를 늘리기보다는 batch size 줄여서 4096 정도로 유지하는 게 낫지 않을까 싶아요. RoPE 스케일링도 고려해볼 만하고요. 실제로 Llama 2를 8192까지 파인튜닝한 결과들 보면 perplexity 차이가 크지 않더라고요. 전 보통 긴 문맥은 sliding window로 겹쳐서 청킹하더라고요. 정보 손실을 줄일 수 있거든요. 다만 VRAM이 24GB면 context length를 늘리기보다는 batch size 줄여서 4096 정도로 유지하는 게 낫지 않을까 싶아요. RoPE 스케일링도 고려해볼 만하고요. 실제로 Llama 2를 8192까지 파인튜닝한 결과들 보면 perplexity 차이가 크지 않더라고요.