2026.09.23 접속자 139
로그인 회원가입
HOT
[프롬프트] 코드 리뷰 프롬프트 효과본 누계 있으세요? [AI뉴스] 한국 AI 기본법 시행됐는데 회사에서 뭘 준비해야 하나요? [AI뉴스] 최근 LLM 모델들 정리해봤는데 진짜 미친 속도로 늘어나네요 [기술 Q&A] 최신 LLM들의 컨텍스트 윈도우 비교해보니 생각보다 차이 크네요 [AI뉴스] GPT-6 Astra 나왔다는데 동시에 ChatGPT 먹통? 이게 뭐하는 짓인지 모르겠네요 [AI뉴스] 요즘 딥러닝 논문들 보니 진짜 방향이 바뀌고 있네요 [프롬프트] 클로드한테 물어볼 때 이 프롬프트 쓰니까 훨씬 낫더라고요 [자유게시판] 카페인 끊었더니 달라진 거 있으신가요? [AI뉴스] 최근 LLM 출시 물량 정말 많네요.. 이 정도면 너무 많은 거 아닌가요? [자유게시판] 신발 끈 자꾸 풀리는데 이게 정상인가요? [프롬프트] 코드 리뷰 프롬프트 효과본 누계 있으세요? [AI뉴스] 한국 AI 기본법 시행됐는데 회사에서 뭘 준비해야 하나요? [AI뉴스] 최근 LLM 모델들 정리해봤는데 진짜 미친 속도로 늘어나네요 [기술 Q&A] 최신 LLM들의 컨텍스트 윈도우 비교해보니 생각보다 차이 크네요 [AI뉴스] GPT-6 Astra 나왔다는데 동시에 ChatGPT 먹통? 이게 뭐하는 짓인지 모르겠네요 [AI뉴스] 요즘 딥러닝 논문들 보니 진짜 방향이 바뀌고 있네요 [프롬프트] 클로드한테 물어볼 때 이 프롬프트 쓰니까 훨씬 낫더라고요 [자유게시판] 카페인 끊었더니 달라진 거 있으신가요? [AI뉴스] 최근 LLM 출시 물량 정말 많네요.. 이 정도면 너무 많은 거 아닌가요? [자유게시판] 신발 끈 자꾸 풀리는데 이게 정상인가요?
API연동

LLM 파인튜닝 할 때 토큰 수 계산 이게 맞나요?

코드리뷰어 2026.09.05 11:31 조회 433 추천 10 댓글 2건
요즘 회사에서 자체 데이터로 라마2 파인튜닝을 시작했는데, 토큰 계산하는 부분에서 자꾸 헷갈려요. 학습 데이터셋이 약 100만 개 문장인데 이걸 토큰 수로 환산하면 보통 어느 정도가 나오나요? 사람마다 다르게 말해서요.

어떤 사람은 평균 토큰이 워드당 1.3배 정도라고 하고, 또 누군가는 한국어면 1.5~2배까지 봐야 한다고 하네요. 근데 정확히 계산하는 방법이 뭔지 몰라서 자꾸 추정치만 나오거든요.

혹시 정확하게 토큰 카운팅하는 방법 있으면 알려주세요. 그리고 이 정도 데이터량이면 충분한 건가요? 아니면 더 모아야 하나요?
추천 10 비추천 0
댓글 2

댓글목록

profile_image
오늘도살자
정확한 토큰 카운팅이려면 실제 사용할 토크나이저로 직접 계산해야 합니다. 라마2면 llama2 토크나이저나 huggingface의 토크나이저를 써서 샘플 데이터 몇천 개 문장을 돌려보면 평균 토큰/문장이 나와요. 그걸로 100만 개 전체를 추정하는 게 가장 정확하더라고요.
한국어는 확실히 1.5~2배가 맞는데, 이건 형태소 분석 여부에 따라서도 달라집니다. 워드 단위보다 자모 단위로 쪼개지는 경향이 있거든요.
데이터량은 100만 개 문장이면 기초 파인튜닝으로는 쓸 만한데, 도메인 특화 성능을 원하면 퀄리티가 더 중요합니다. 그
profile_image
조용한엔지니어
토크나이저 직접 돌려보는 게 제일 확실해요. Hugging Face의 `transformers` 라이브러리에서 라마2 토크나이저 로드해서 샘플 문장들 몇 개 돌려보면 실제 비율이 나옵니다. 한국어는 정말 개수도 많고 복잡해서 추정만 가지고는 위험해요.
데이터량 관련해선 100만 문장이면 나쁘지 않은데 결국 토큰 수가 중요거든요. 라마2 기준으로 최소 수억 토큰은 있으면 의미 있는 파인튜닝이 가능합니다. 보통 고정된 에포크 수로 반복 학습하는 방식도 많으니까 전체 토큰 규모를 먼저 파악하고 그다음에 에포크 설정하시는 게 낫습니다.
참고로 토크