최근 프로젝트에서 Claude 3.5 Sonnet으로 RAG 구축 중인데 좀 이상한 현상을 발견했어요. Context window를 200K로 늘려서 더 많은 문서를 한 번에 밀어넣으면 관련성 높은 청크를 더 많이 포함할 수 있을 줄 알았는데, 오히려 최종 답변이 덜 정확해지더라고요.
처음엔 토큰 문제인 줄 알았는데 그것도 아니고, 혹시 너무 많은 정보가 들어가면서 모델이 헷갈리는 건 아닐까 싶어요. 아니면 retrieval 단계에서 ranking을 좀 더 엄격하게 해야 하는 걸까요? 비슷한 경험 있으신 분이 있으면 조언 부탁드립니다.