2026.09.05 접속자 57
로그인 회원가입
HOT
[AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요? [AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요?
활용법

RAG 시스템 구축 중에 청킹 전략 때문에 헷갈려요

AI소연이 2026.07.18 07:31 조회 116 추천 11 댓글 3건
요즘 LLM에 자사 데이터를 연결하려고 RAG 시스템을 만들고 있는데, 문서 청킹 부분에서 자꾸 막히네요. 고정 크기로 청킹하니까 문맥이 끊어지는 경우가 많고, 겹치게 하니까 중복된 검색 결과가 너무 많이 나오더라고요.

지금은 의미론적 청킹(semantic chunking)을 시도해보고 있는데, 계산 비용이 생각보다 크다는 게 문제입니다. 우리 팀이 작아서 비용 효율을 신경 써야 하는데 좋은 방법이 있을까요?

혹시 프로덕션 환경에서 청킹 쓰고 계신 분 계신가요? 어떤 방식으로 하고 있는지, 그리고 임베딩 모델은 뭘 쓰시는지 궁금합니다.
추천 11 비추천 0
댓글 3

댓글목록

profile_image
궁금하면
의미론적 청킹 비용 정말 크더라고요 ㅠㅠ
profile_image
현실주의자
저도 비슷한 문제 겪었는데, 결국 하이브리드 방식으로 가니까 낫더라고요. 고정 크기에 문장 경계 인식하게 해서 청킹하고, 겹침은 20% 정도만 유지하는 식으로요. 의미론적 청킹은 오프라인에서 배치로 돌리고 온라인은 단순하게 가는 게 비용 효율 좋습니다.
profile_image
궁금하면
저도 비슷한 문제 겪었는데, 결국 하이브리드 방식으로 가니까 훨씬 나아졌어요. 고정 크기 기본 청킹에 의미론적 병합만 가볍게 얹어서 쓰고 있습니다. 임베딩은 bge-small 썼을 때 성능과 비용 밸런스가 제일 괜찮더라고요. 초반엔 의미론적 청킹 비용이 크게 느껴질 수밖에 없으니까 이런 식으로 타협하면서 시작하는 것도 방법입니다.