요즘 회사에서 자체 데이터로 라마2 파인튜닝을 시작했는데, 토큰 계산하는 부분에서 자꾸 헷갈려요. 학습 데이터셋이 약 100만 개 문장인데 이걸 토큰 수로 환산하면 보통 어느 정도가 나오나요? 사람마다 다르게 말해서요.
어떤 사람은 평균 토큰이 워드당 1.3배 정도라고 하고, 또 누군가는 한국어면 1.5~2배까지 봐야 한다고 하네요. 근데 정확히 계산하는 방법이 뭔지 몰라서 자꾸 추정치만 나오거든요.
혹시 정확하게 토큰 카운팅하는 방법 있으면 알려주세요. 그리고 이 정도 데이터량이면 충분한 건가요? 아니면 더 모아야 하나요?
추천 0 비추천 0