
AI 코드 리뷰 자동화, 판정은 왜 흔들릴까 - 원인과 해결법 4가지
같은 코드를 리뷰시켜도 판정이 매번 달라지는 이유는 LLM의 비결정성 때문입니다. temperature를 0으로 내려도 흔들림은 남습니다. 코드 위임·폭 좁히기·다수결·하네스로 LLM 판정의 일관성을 높이는 네 가지 방법을, 총 55회 호출 실험 결과와 함께 정리했습니다.

같은 코드를 리뷰시켜도 판정이 매번 달라지는 이유는 LLM의 비결정성 때문입니다. temperature를 0으로 내려도 흔들림은 남습니다. 코드 위임·폭 좁히기·다수결·하네스로 LLM 판정의 일관성을 높이는 네 가지 방법을, 총 55회 호출 실험 결과와 함께 정리했습니다.

프롬프트를 최적화하려면 품질을 정량적으로 측정하고, 개선하는 작업부터 시작해야 합니다. Prometheus 2와 OpenAI API를 활용하면 이를 더욱 빠르게 정량 평가하고, 데이터에 기반해 실질적인 프롬프트 개선 방안을 도출할 수 있습니다. 이 글은 두 도구를 활용한 프롬프트 품질 평가 방법을 실습 예제와 함께 다뤘습니다.