최근 팀에서 코드 리뷰 프로세스를 좀 더 효율적으로 하려고 LLM을 활용해보려고 했어요. Claude API를 붙여서 PR에 올라온 코드를 자동으로 분석하고 피드백을 달아주는 시스템을 만들어봤거든요.
처음엔 정말 잘 되는 것처럼 보였어요. 변수명 컨벤션, 타입 안정성, 간단한 로직 개선 같은 건 꽤 잘 잡아내더라고요. 근데 실제로 쓰다 보니 문제가 많았습니다. 도메인 지식이 필요한 부분은 엉뚱한 지적을 하고, 팀의 코딩 스타일과 맥락을 이해 못 해서 불필요한 리뷰 코멘트가 너무 많았어요. 특히 비즈니스 로직 부분은 거의 참고 안 됐습니다.
결국 지금은 명백한 문제(보안 이슈, 중복 코드 같은 것)만 자동으로 걸러내고, 실질적인 리뷰는 여전히 사람이 하는 방식으로 운영하고 있어요. LLM이 다 할 수 있을 것처럼 기대했던 게 좀 순진했나 싶네요.
다만 정리하자면 스니펫 생성이나 테스트 케이스 작성 보조, 문서화 같은 부분에선 꽤 도움이 되고 있습니다. 생각해보니 LLM의 강점과 약점을 제대로 파악하고 써야 한다는 걸 배웠어요. 다른 분들도 비슷한 시도를 하셨다면 어떤 방식으로 운영하시는지 궁금합니다. 프롬프트 엔지니어링으로 좀 더 나아질 수도 있을 것 같긴 한데 의견 나눌 수 있으면 좋을 것 같습니다.