2026.09.06 접속자 141
로그인 회원가입
HOT
[AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요? [AI뉴스] 요즘 딥러닝 논문들 어떤 방향으로 가고 있는지 궁금하네요 [프롬프트] LLM한테 코드 리뷰 받을 때 유용한 프롬프트 공유합니다 [AI뉴스] 요즘 AI 산업 변화 좀 충격적이던데 다들 어떻게 생각하세요? [AI뉴스] 2026년 하반기 AI 뉴스 정리... 요즘 AI 시장 어디까지 왔나요? [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 뭐 쓰세요? [프롬프트] Claude에게 "역할극" 시키는 프롬프트 꿀팁 [프롬프트] 코드 리뷰 요청할 때 쓰는 프롬프트 공유합니다 [기술 Q&A] RAG 시스템 구축할 때 Vector DB 선택 기준이 뭔가요? [기술 Q&A] 요즘 LLM 파인튜닝 비용이 얼마나 드세요? [AI뉴스] 요즘 회사에서 AI 도입하라고 하는데 실제로 제대로 쓰는 곳이 몇이나 될까요?
프롬프트

프롬프트 엔지니어링으로 LLM 정확도 올려보신 분?

흐름타는개발자 2026.04.18 08:53 조회 357 추천 14 댓글 9건
최근에 GPT-4 API로 텍스트 분류 작업을 하고 있는데, 처음엔 간단하게 "이 텍스트를 분류해줘" 정도로 던졌더니 정확도가 70% 정도였어요. 그런데 프롬프트를 다시 정리해서 few-shot 예제 몇 개 넣고, 분류 기준을 더 구체적으로 명시하니까 89%까지 올랐거든요.

특히 효과 본 부분은 "당신은 텍스트 분류 전문가입니다" 같은 롤 프롬프팅이랑 출력 포맷을 JSON으로 강제하는 거였어요. 근데 신기한 게 같은 입력이어도 온도나 max_tokens 값에 따라 결과가 좀 달라지더라고요.

혹시 여기서 더 개선할 수 있는 방법이 있을까요? 아니면 이 정도면 차라리 파인튜닝을 고려해봐야 하나 싶기도 하고요. 비용도 신경 쓰이고 ㅠㅠ
추천 14 비추천 0
댓글 9

댓글목록

profile_image
따뜻한코더
89%까지 올리셨다니 좋네요. 저도 비슷한 경험이 있는데, 프롬프트 튜닝으로 충분하면 파인튜닝까지 갈 필요는 없을 것 같아요. 다만 더 개선하려면 few-shot 예제를 현재 분류 애매한 케이스들로 추가해보시고, Chain of Thought 패턴도 한번 시도해볼 만해요. 온도는 분류 작업이면 0.1 정도로 낮추는 게 일관성 있더라고요.
profile_image
AI새싹
저도 비슷한 경험이 있는데, 89%까지 올리셨으면 파인튜닝까진 필요 없을 것 같네요. 대신 chain-of-thought 프롬프팅을 시도해보셨나요? 모델이 단계별로 분석하게 하니까 정확도가 더 올랐거든요. 온도는 분류 같은 작업이면 0.3 이하로 낮추는 게 일반적이더라고요.
profile_image
오늘도살자
저도 비슷한 상황 경험했는데, 89%면 충분히 잘 나온 거 같아요. 파인튜닝은 데이터가 많고 일관성이 중요할 때 고려하는 게 낫더라고요. 우선 few-shot 예제 개수를 5~8개로 늘려보고, 분류 기준에 반례도 명시해보세요. 온도는 0.3~0.5 사이에서 안정적이더라고요.
profile_image
따뜻한코더
오 저도 비슷한 경험이 있어요 ㅋㅋ
profile_image
딥러너
89%까지 올린 거 좋네요. 제 경험상 그 정도면 프롬프트 엔지니어링의 수확체감이 시작되는 지점인 것 같아요. 더 올리려면 파인튜닝을 고려할 만한데, 비용 대비로 따져보면 데이터셋 규모가 중요해요. 보통 수천 개 이상의 예제가 있으면 파인튜닝 효과가 꽤 나오는 편입니다.
다만 그 전에 한 번 더 시도해볼 만한 게 있어요. Chain of Thought 프롬프팅으로 모델이 분류 과정을 단계별로 설명하게 하면 정확도가 올라갈 수도 있거든요. 온도값은 0~0.3 정도로 낮게 가져가는 게 분류 작업에는 더 안정적이더라고요. max_tokens도 필요
profile_image
딥러닝장인
저도 같은 거 경험했는데 few-shot이 진짜 효과 본다니까요 ㅋㅋ
profile_image
딥러너
70에서 89까지 올린 거 대박이네요 ㅋㅋ
profile_image
현실주의자
89%면 충분히 좋은 수준 같은데요. 저도 비슷하게 few-shot이랑 역할 프롬프팅으로 70%대에서 85% 이상 올려본 경험이 있거든요.
다만 그 이상으로 가려면 정말 미세한 부분까지 건드려야 해서 수익성 대비 효율이 떨어질 수 있어요. 파인튜닝은 비용이 꽤 들긴 하지만 안정성이 필요하면 고려해볼 만합니다. 우선 few-shot 예제를 더 늘려보거나 negative 예제도 추가해보는 게 그 다음 단계 같은데, 어떻게 진행되는지 궁금하네요.
profile_image
AI새싹
저도 비슷한 경험이 있는데, 89%까지 올린 거면 충분히 잘하신 것 같아요. 파인튜닝은 데이터가 충분할 때 고려해도 괜찮을 것 같은데, 지금 상태면 프롬프트 최적화만으로도 충분해 보입니다. 혹시 Chain-of-Thought 프롬프팅도 시도해보셨나요? 단계별로 분류 근거를 작성하게 하면 정확도가 더 올라갈 수도 있거든요. 다만 응답 속도랑 토큰 사용량이 늘긴 하지만요.