AI 생성 코드의 검증 루프 설계와 측정
훅 19종의 에이전트 하네스부터 프로덕션 LLM 파이프라인까지 설계하고 운영합니다. AI가 만든 코드는 빌드와 테스트를 통과해도 결함이 남습니다. 그래서 규칙을 문서가 아니라 훅으로 집행하는 하네스를 만들었고 하네스 자체에도 CI 검증을 붙였습니다. 그래도 믿지 않았습니다. 45일치 세션 기록을 대조해 경고 859회에 행동 변화가 0인 훅을 찾아 제거했습니다. 운영에서는 모킹 테스트가 통과한 채로 AI 기능이 전량 실패한 적이 있습니다. 원인은 제공사의 모델 폐기였고 그 뒤 완료 기준에 실제 추론 왕복을 넣었습니다. 감으로 정할 수 있는 것도 표로 받습니다. 번역 모델은 "전용 모델이 낫겠지"라는 직관 대신 204건을 행 단위로 읽고 골랐고 직관이 틀렸음을 확인했습니다. 이 루프에서 제 몫은 제약 설정, 완료 기준 요구, 게이트 배치, 감사 발주, 근거 판정입니다.

