AI 에이전트로 여러 제품을 만들어 보니 모델은 충분히 똑똑한데도 일을 오래 맡길수록 같은 문제가 되풀이됐습니다. 제가 겪은 불편과 집현이 그 불편을 다루는 방식을 나란히 적었습니다.
제가 겪은 불편집현이 하는 일
일이 끝나도 확인하지 않은 채 손을 놓고, 제가 자는 동안에는 아예 멈춘다뒤에서 도는 실행 커널이 업무 상태를 쥐고 있어 앱을 다시 켜도 하던 일을 이어 갑니다
맥락을 잃는다업무 상태의 원본을 대화 기록이 아닌 데이터베이스에 두고, 업무마다 필요한 맥락만 골라 넘깁니다
엉뚱한 일에 빠져 요구사항과 다른 것을 만든다만들기 전에 완료 기준을 확정하고, 요구사항마다 충족 여부를 따로 기록합니다
하지 말라고 한 일을 한다여러 권한 조건을 모두 충족할 때만 실행하고, 되돌릴 수 없는 일은 늘 결재를 거칩니다
"다 했습니다"라고 했는데 열어 보면 빠진 것이 많다AI의 보고 대신 검사 결과와 독립 검증으로 판정합니다
의미 없는 검증을 몇 시간씩 돌리고, 검증을 또 검증한다같은 실패가 두 번 나오면 멈추고 결재로 올리며, 다시 만드는 횟수에도 한도를 둡니다
보안 사고를 낸다격리가 실제로 되는지 시험한 뒤에만 코드를 실행하게 하고, 비밀값은 앱 안에 두지 않습니다
같은 실수를 해도 규칙으로 남지 않아 또 반복한다바로잡은 실수는 교정 기록으로 남기고, 되풀이되는 실수는 규칙으로 올려 다음 업무부터 막습니다
처음에는 역할을 나누면 해결될 줄 알았습니다. 기획, 개발, 검토를 맡는 에이전트를 따로 두었지만, 같은 모델이 같은 맥락에서 서로의 결과에 동의해 버리는 일이 생겼습니다. 에이전트를 늘린다고 결과가 더 믿을 만해지지는 않았습니다. 그래서 질문을 "AI에게 일을 시킬 수 있는가"에서 "AI에게 맡긴 결과를 사람이 믿을 수 있는가"로 바꿨습니다.
회사처럼 만든 데는 이유가 있습니다. 삼성전자에서 일하며 조직이 일을 어떻게 나누고 결재로 책임을 정하는지 오래 봤고, PM으로서 여러 이해관계자에게 일을 맡기고 조율해 왔습니다. AI 직원에게 일을 시키는 경험이 대표나 PM이 팀에 일을 맡길 때와 같아야 누구나 바로 쓸 수 있다고 생각했습니다.