2026.09.05 접속자 75
로그인 회원가입
HOT
[AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요? [AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요?
활용법

LLM 파인튜닝할 때 토큰 길이 제한 때문에 헤매고 있는데...

인공지능개그맨 2026.04.22 09:07 조회 304 추천 13 댓글 9건
요즘 자사 데이터로 LLM을 파인튜닝하려고 하는데 context window 문제 때문에 좀 막히네요. 현재 쓰고 있는 모델은 4k 토큰 제한이 있는데, 우리가 처리해야 할 문서들이 보통 5~10k 정도 길이거든요.

당연히 토큰을 자르거나 청킹해서 학습시키는 게 가장 간단한 방법인 건 알겠는데, 그러면 문맥이 끊기면서 학습 효율이 떨어질 것 같아요. 특히 길게 이어지는 맥락이 중요한 도메인이라서 더 신경이 쓰여요.

혹시 이런 상황에서 효과적으로 처리하는 방법 써보신 분 계신가요? 슬라이딩 윈도우로 오버래핑하게 나누는 게 베스트 프랙티스인지, 아니면 더 좋은 방법이 있는지 궁금합니다. 롱텍스트 모델(Claude, GPT-4 Turbo 같은)로 먼저 요약본을 만들고 그걸 학습시키는 건 어떨까 싶기도 하고요.

혹은 요즘 같은 경우 처음부터 긴 context 지원하는 모델로 파인튜닝하는 게 나을까요? 라마 2나 Mistral 같은 오픈소스 모델들 중에 추천할 만한 게 있으면 알려주세요. 비용도 비용이지만 우리 인프라에서 돌릴 수 있는 걸 찾는 게 중요해서요.

먼저 손으로 몇 건 테스트해본 결과는 슬라이딩 윈도우가 나쁘진 않더라고요. 다만 검증 데이터셋이 작아서 유의미한 결론을 내기가 어렵네요. 혹시 이런 식으로 파이프라인을 짜본 분들이 있다면 경험담 좀 나눠주세요.
추천 13 비추천 0
댓글 9

댓글목록

profile_image
AI새싹
슬라이딩 윈도우 오버래핑은 확실히 좋은 방법 같긴 한데, 저는 요약 방식도 한 번 써봤거든요. 근데 요약하는 과정에서 도메인 특화 정보가 손실되는 게 신경 쓰였어요.
차라리 처음부터 Mistral 같은 8k 이상 지원하는 모델로 가는 게 낫지 않을까 싶네요. 파인튜닝 비용도 시간도 절약되고요. 요즘 오픈소스들이 성능도 괜찮은데 맥락 유지하는 데는 더 좋더라고요.
혹은 문서를 시맨틱 기준으로 나누되 겹치는 부분을 크게 잡는 방식도 있습니다. 그냥 토큰으로만 자르는 것보다는 낫긴 해요.
profile_image
딥러닝장인
슬라이딩 윈도우 오버래핑이 현실적으로 제일 나은 것 같아요. 요약으로 줄이면 중요한 뉘앙스 손실되더라고요.
profile_image
GPT덕후하나
저도 비슷한 문제로 고생했는데 슬라이딩 윈도우 오버래핑이 제일 무난하더라고요. 다만 요약본 만드는 건 정보 손실이 커서 별로였어요. 차라리 Mistral이나 Llama2의 확장 버전(32k, 70k) 쓰는 게 처음부터 깔끔할 것 같습니다.
profile_image
따뜻한코더
오 슬라이딩 윈도우 방식 괜찮더라고요 ㅋㅋ
profile_image
오늘도살자
저도 같은 문제로 헤맨 적 있는데 ㅠㅠ
profile_image
딥러너
저도 비슷한 문제 겪었는데 슬라이딩 윈도우로 50% 오버래핑하게 나누는 게 실제로 효과 있더라고요. 문맥 연속성이 많이 보존돼요.
다만 요약본 학습은 개인적으로는 별로였어요. 도메인 특화 정보가 손실되는 경우가 많아서요.
차라리 처음부터 8k 이상 지원하는 모델(Mistral 8x7B나 최신 Llama 2 기반 모델들)로 가시는 게 낫습니다. 파인튜닝 시 context 확장도 가능하고요. 비용이 조금 더 들겠지만 품질 차이가 확실해요.
profile_image
흐름타는개발자
저도 비슷한 상황 겪었는데 슬라이딩 윈도우 오버래핑이 실제로 꽤 효과 있더라고요. 겹치는 부분이 문맥 연결을 유지해주는 식으로요. 다만 요약본 먼저 만들고 파인튜닝하는 건 정보 손실이 걱정되서 저는 안 했어요. 차라리 처음부터 Llama 2 70B나 Mistral 8x7B 같은 긴 컨텍스트 지원하는 모델로 가는 게 나을 것 같습니다. RoPE scaling이나 ALiBi 같은 기법들이 상당히 개선되어 있거든요.
profile_image
요정
저도 그 문제로 고생했는데 슬라이딩 윈도우가 가장 무난하더라고요
profile_image
흐름타는개발자
저도 비슷한 문제 겪었는데 슬라이딩 윈도우가 생각보다 괜찮더라고요. 근데 진짜 중요한 건 오버래핑 비율인데, 보통 50% 정도로 겹치게 하면 문맥 손실을 꽤 줄일 수 있습니다.
요약본 만들어서 학습시키는 건 좋은 생각인데, 원문과의 정렬 문제가 생길 수 있어요. 실제로는 하이브리드 접근이 낫더라고요. 중요한 섹션은 full context로, 나머지는 요약본으로.
요즘 같으면 차라리 처음부터 Mistral 같은 8k 이상 모델 쓰는 게 낫지 않을까 싶네요. 파인튜닝 비용도 크게 차이 안 나고 문제 자체를 피하는 거