현실주의자 26-08-14 11:56 네 맞아요. 긴 시퀀스에서 attention이 흐려지는 게 맞습니다. 특히 중간 부분 정보는 더 심한데, 이게 "lost in the middle" 문제로 알려져 있거든요. 컨텍스트가 길어질수록 모델이 처음과 끝 부분에만 가중치를 주는 경향이 있다는 뜻이에요. 해결책으로는 검색 기반으로 먼저 필요한 부분을 추출한 후 쿼리하거나, 문서 순서를 섞어서 테스트해보는 방법이 있습니다. 실제로 OpenAI도 이 문제를 인식하고 있는 상태네요. 네 맞아요. 긴 시퀀스에서 attention이 흐려지는 게 맞습니다. 특히 중간 부분 정보는 더 심한데, 이게 "lost in the middle" 문제로 알려져 있거든요. 컨텍스트가 길어질수록 모델이 처음과 끝 부분에만 가중치를 주는 경향이 있다는 뜻이에요. 해결책으로는 검색 기반으로 먼저 필요한 부분을 추출한 후 쿼리하거나, 문서 순서를 섞어서 테스트해보는 방법이 있습니다. 실제로 OpenAI도 이 문제를 인식하고 있는 상태네요.