요즘 여러 LLM을 실무에 써보면서 느끼는 건데, 토큰 길이 제한이 생각보다 크리티컬한 문제더라고요. 특히 긴 문서 분석이나 대화 컨텍스트가 쌓이는 작업할 때요.
GPT-4는 컨텍스트 윈도우가 크긴 한데 비용이 장난 아니고, Claude는 200K라서 쓸만하지만 응답 속도가 아직도 좀 느껴져요. 그래서 결국 실무에선 문서를 여러 청크로 나눠서 처리하거든요. 근데 이렇게 하면 전체 컨텍스트를 못 잡아서 답의 품질이 떨어지는 경우가 있습니다.
혹시 이 문제를 어떻게 해결하고 계신지 궁금해요. RAG를 더 정교하게 하는 건지, 아니면 애초에 다르게 접근하는 건지요.