Job
코딩 에이전트가 우리 저장소에서 매번 똑같은 실수를 반복하고, 그때마다 지시문에 한 줄씩 덧붙이다 보니 파일은 길어졌는데 어느 줄이 실제로 효과가 있는지는 아무도 모르는 상태를 정리합니다. 먼저 실제로 틀렸던 기록에서 실패 유형을 뽑아 재현 가능한 과제 묶음을 만들고, 각 과제에 기계가 채점할 수 있는 합격 기준을 붙입니다. 그다음 지시문·스킬·도구 구성을 한 번에 하나씩만 바꿔 여러 번 반복 실행하고, 통과율이 잡음 범위를 넘어 실제로 올라갔는지 비교합니다. 결과물은 조언이 아니라 적용·되돌리기가 가능한 diff이며, 통과율을 못 올린 줄은 근거와 함께 삭제 대상으로 보고합니다.