2026.07.15 접속자 21명

로그인 | 회원가입 | AI 서비스

HOT

[AI뉴스] 요즘 AI 기업들 뭐 하는지 봤어요? 삼성부터 구글까지 정신없네 [자유게시판] 요즘 편의점 계절 신상 많던데 뭐가 괜찮더라고요 [자유게시판] 편의점 야식을 계속 사먹다니 이게 뭐 하는 짓이냐 [프롬프트] 마케팅 복사문 작성할 때 쓰는 프롬프트 공유해요 [자유게시판] 편의점 야시간 알바 2주 후기 [자유게시판] 직장 다니면서 운동 어떻게 하세요? [자유게시판] 편의점 알바 3개월 해본 솔직한 후기 [프롬프트] 코드 생성할 때 프롬프트 구조 어떻게 짜세요? [AI뉴스] GPT-5.6 드디어 풀렸네요, 그리고 요즘 AI 흐름 정리해봤어요 [AI뉴스] 한국 AI 기본법 벌써 시행됐는데 워터마크 표시 의무까지... 요즘 AI 만드는 회사들 뭐 해야 하나요? [AI뉴스] 요즘 AI 기업들 뭐 하는지 봤어요? 삼성부터 구글까지 정신없네 [자유게시판] 요즘 편의점 계절 신상 많던데 뭐가 괜찮더라고요 [자유게시판] 편의점 야식을 계속 사먹다니 이게 뭐 하는 짓이냐 [프롬프트] 마케팅 복사문 작성할 때 쓰는 프롬프트 공유해요 [자유게시판] 편의점 야시간 알바 2주 후기 [자유게시판] 직장 다니면서 운동 어떻게 하세요? [자유게시판] 편의점 알바 3개월 해본 솔직한 후기 [프롬프트] 코드 생성할 때 프롬프트 구조 어떻게 짜세요? [AI뉴스] GPT-5.6 드디어 풀렸네요, 그리고 요즘 AI 흐름 정리해봤어요 [AI뉴스] 한국 AI 기본법 벌써 시행됐는데 워터마크 표시 의무까지... 요즘 AI 만드는 회사들 뭐 해야 하나요?

목록

API연동

LLM fine-tuning 직접 해보니까 생각보다 복잡하네요

딥러닝장인 2026.05.25 20:07 조회 127 추천 12 댓글 2건

회사에서 특정 도메인 데이터로 모델을 파인튜닝해야 할 일이 생겼는데, 실제로 해보니까 이론으로 배운 것과는 꽤 차이가 있더라고요. 처음엔 간단할 줄 알았는데 중간에 여러 문제에 마주쳤습니다.

일단 학습 데이터 준비 단계에서 생각보다 오래 걸렸어요. 약 5000개 정도의 샘플을 수집했는데 데이터 품질 문제가 상당했습니다. 라벨링 오류도 있고 형식도 일관성 없고 해서 전처리만 2주가 걸렸네요. 다들 이 부분이 전체 작업의 70~80%를 차지한다고 했는데 정말 그 말이 맞는 것 같습니다.

그 다음 하이퍼파라미터 튜닝이 문제였어요. learning rate, batch size, epoch 같은 것들을 적절히 설정해야 하는데 이게 정말 경험의 영역이더라고요. 몇 번을 시행착오를 거쳐야 하는데 GPU 비용도 만만치 않고요. 저는 결국 LoRA를 써서 계산량을 줄였는데 성능 손실이 크지 않으면서 훈씬 효율적이었습니다. 여러분도 비용 문제 있으시면 LoRA 추천합니다.

마지막으로 평가 메트릭 설정도 헷갈렸어요. 정확도만 봐서는 안 되고 도메인에 맞는 지표를 따로 정의해야 하더라고요. 저희는 결국 도메인 전문가한테 샘플 결과를 보여주고 직접 평가를 받는 수밖에 없었습니다.

전체적으로 보니까 파인튜닝은 생각보다 장난 아닌 프로젝트네요. 그래도 결과물이 나왔을 때의 만족감은 꽤 컸습니다. 비슷한 작업 계획 중이신 분들은 데이터 품질에 정말 신경 쓰시고 초반에 시간을 충분히 잡아두시길 추천합니다. 중간에 데이터 문제로 인한 재작업은 정말 피곤하거든요.

추천 12 비추천 0

이전글RAG 시스템에서 토큰 길이 제한 때문에 고민이네요26.05.26
다음글요즘 로컬 LLM 써보신 분 계신가요?26.05.24

댓글 2

댓글목록

GPT덕후하나

26-06-07 04:07

데이터 전처리가 정말 반이더라고요 ㅋㅋ

딥러너

26-07-11 05:16

저도 비슷한 경험했는데 정말 공감됩니다. 데이터 전처리가 정말 끝이 없더라고요. 5000개면 꽤 된다고 생각했는데 라벨링 오류 잡으면서 원점으로 돌아가는 경우도 많았어요.
LoRA 얘기는 정말 좋은 팁이네요. 저도 처음엔 full fine-tuning으로 시도했다가 비용이 장난 아니더라고요. LoRA로 전환하니까 거의 성능 차이 못 느끼면서 GPU 비용은 10분의 1 수준으로 줄었습니다. 특히 회사 프로젝트라면 더 필수 같아요.
혹시 평가 메트릭 설정할 때 특정 메트릭으로 결정했나요? 저는 도메인마다 어떤 메트릭을 우선시할지가