post
AI한테 시험을 냈는데 출제자가 5번 틀렸다 - LLM 파이프라인 검증기
카톡 주문 메시지를 상품 코드로 바꿔주는 LLM 파이프라인 테스트를 만들었는데, 테스트 자체의 정답지 3개와 채점기 2개가 틀렸습니다. 출제자가 직접 심어둔 함정에 빠졌고, 모델이 '확인 필요'라고 되물은 것이 정답이었습니다.
한 줄 요약
LLM 파이프라인 검증을 위해 만든 테스트에서 정답지 3개, 채점기 2개가 틀렸는데, 모델이 이를 정확히 지적했습니다.
핵심 내용
카톡 주문 메시지를 상품 코드로 변환하는 LLM 파이프라인 테스트 29개 작성 (정답지·채점기 포함)
두 모델 모두 치명 오류 0건 통과했으나, 정답지 3번과 채점기 2번이 실제로 틀림
출제자가 직접 심어둔 함정에 빠졌고, 모델이 "확인 필요"라고 되물은 것이 정답
애매한 문제의 정답은 확정이 아니라 "확인 필요"로 두는 검증 규칙 적용
데이터 함정: 같은 이름 상품 2종, 비슷한 규격 5종 등으로 테스트 케이스 설계
Haiku 4.5(싼 모델)와 Sonnet 5(3배 비싼 모델)의 차이는 딱 1문제
왜 중요한가
LLM 파이프라인의 품질을 검증할 때, 테스트 자체가 얼마나 중요한지 보여줍니다. 작성자가 직접 정답지와 채점기를 만들었는데도 5개가 틀렸다는 것은, AI를 검증하기 위해 얼마나 철저한 테스트 설계가 필요한지 실증합니다. 모델이 "확인 필요"라고 되물을 수 있게 규칙을 설정한 것처럼, 애매한 경계 사례에 대한 명확한 기준이 LLM 파이프라인 안정성의 핵심입니다.
참조한 것 · 가져온 것
원문: https://velog.io/@ramses203/ai-exam-author-wrong-5-times
GeekNews: https://news.hada.io/topic?id=32231