post
AI 코드 리뷰는 몇 번 돌려야 할까.. 약 400번 돌려보고 알게 된 것
한 줄 요약 약 400회의 LLM 호출로 측정한 결과, AI 코드 리뷰-수정 반복에서는 리뷰만 반복하는 것과 달리 코드 크기만 커지고 품질 향상이 제한적입니다.
한 줄 요약
약 400회의 LLM 호출로 측정한 결과, AI 코드 리뷰-수정 반복에서는 리뷰만 반복하는 것과 달리 코드 크기만 커지고 품질 향상이 제한적입니다.
핵심 내용
같은 코드를 반복 리뷰만 하면 결함 커버리지가 34% → 61% → 76%로 증가
같은 코드·같은 모델도 매번 발견하는 문제가 달라 한 번의 리뷰는 불충분
리뷰-수정 루프 반복 시 테스트·계약 준수율은 유지되나 코드는 24~152% 증가
여러 리뷰에서 반복된 지적이 반드시 정확한 것 아님, 오탐이 실제 결함보다 자주 반복 보고
Repository context 제공 시 오탐이 29%에서 현저히 감소, 모델에게 제공할 정보 범위 중요
여러 라운드 후 지적 없음이 나왔어도 다른 관점 리뷰에서 새로운 failure mode 발견
테스트 통과만으로는 종료 판단 불가, 코드 복잡도는 크게 달라짐
왜 중요한가
AI 코딩 에이전트 자동화 시 리뷰-수정 루프는 필수지만, 언제 종료할지에 대한 일관된 기준이 부족했습니다. 이 실험은 리뷰와 수정을 분리해서 생각해야 하며, 종료 조건(finding=0, 테스트 통과, 라운드 제한)을 단독으로 쓸 수 없음을 보여줍니다.
참조한 것 · 가져온 것
원문: https://edgelog.dev/ko/blog/how-many-ai-code-reviews/
GeekNews: https://news.hada.io/topic?id=32842