새 AI 모델을 고르기 전에 바꿀 업무부터 정하세요
AI로 바꿀 업무를 입력과 결과가 분명한 단위로 좁히세요. 정확성뿐 아니라 검토와 수정에 드는 시간까지 성공 기준에 넣으세요. 같은 사례로 모델을 비교하고, 중단하거나 사람에게 넘길 조건을 정하세요.
“새 모델이 나왔으니 우리도 바꿔야 하지 않을까요?”
도입 회의가 모델 비교로 시작하면, 정작 어떤 업무를 개선할지는 뒤로 밀리기 쉽습니다. 모델을 비교하려면 먼저 무엇을 잘하면 우리 업무에 도움이 되는지가 정해져 있어야 합니다.
고객 문의 답변을 작성하는 가상 업무로 순서를 정리해 보겠습니다.

업무 이름을 입력과 결과가 보이게 좁힙니다
‘고객 응대 자동화’는 범위가 넓습니다. 문의 분류, 자료 검색, 답변 작성, 고객 전송이 모두 들어갈 수 있습니다.
첫 실험은 이렇게 좁혀보세요.
고객의 제품 사용 문의와 최신 안내 문서를 받아, 근거 링크가 붙은 답변 초안을 만든다. 담당자가 확인한 뒤 전송한다.
이제 필요한 입력, 기대 결과, 사람이 맡을 일이 보입니다. 취소나 분쟁처럼 다른 판단이 필요한 문의는 이번 실험의 범위에서 제외할 수 있습니다.
성공 기준에 사람의 검토 시간을 포함합니다
초안 생성 속도만 비교하면 실제 효과를 과대평가할 수 있습니다. 최종 답변을 보내기까지 걸리는 시간을 함께 봐야 합니다.
가령 기존 작성에 12분이 걸리던 업무가 AI 초안 1분, 검토와 수정 8분으로 바뀌었다면 총 9분입니다. 줄어든 시간은 11분이 아니라 3분입니다. 이 숫자는 계산 방법을 보여주는 가상 예시이며 실제 성과가 아닙니다.
시간 외에도 다음 기준을 정해 두세요.
- 답이 안내 문서와 일치하는가.
- 첨부한 링크가 실제 답의 근거인가.
- 자료에 없는 내용은 확인 필요로 남기는가.
- 담당자가 손봐야 할 오류가 무엇인가.
품질이 낮은 빠른 답변과 품질을 유지한 시간 단축을 구분해야 합니다.
같은 사례로 모델을 비교합니다
일반 문의, 예외 문의, 자료에 답이 없는 문의를 모으고 입력 자료와 지침을 고정합니다. 그다음 모델을 바꾸어 같은 조건으로 실행해 보세요.
어려운 사례 하나에서 우연히 잘 나온 결과보다 여러 사례에서 반복되는 실패가 중요합니다. 모델이나 지침을 수정했다면 이전에 통과한 사례도 다시 확인합니다.
Anthropic의 에이전트 설계 글은 가능한 단순한 방식으로 시작하고, 성능 개선이 확인될 때 복잡성을 늘리라고 제안합니다. 이 원칙을 적용하면 단일 초안 작성으로 충분한 업무에 여러 에이전트부터 붙일 이유가 줄어듭니다. 설계 원칙
계속할 조건과 멈출 조건을 함께 적습니다
시험을 시작하기 전에 다음 상황의 처리 방법을 정합니다.
- 근거 문서가 없으면 담당자에게 넘긴다.
- 적용 대상이 불분명하면 고객에게 필요한 정보를 확인한다.
- 검토 시간이 줄지 않으면 업무 범위나 자료를 다시 정리한다.
- 중요한 사실 오류가 나오면 자동 전송 범위를 넓히지 않는다.
조건이 있어야 “느낌상 좋아졌다”는 평가에서 벗어날 수 있습니다.
오늘 도입 후보 업무 하나를 입력, 결과, 성공 기준, 사람에게 넘길 조건 네 줄로 적어보세요. 그다음 모델을 비교하면 선택의 이유가 분명해집니다.
FAQ
최신 모델을 쓰는 것이 항상 유리하지 않나요?
업무에 따라 정확성, 속도, 비용, 도구 연결 조건이 다릅니다. 최신이라는 이유만으로 바꾸기보다 같은 사례에서 어떤 결과가 달라졌는지 확인하세요.
실험은 몇 건이면 충분한가요?
모든 업무에 통하는 건수는 없습니다. 자주 들어오는 유형과 중요한 예외를 포함해 시작하고, 실패가 계속 새로 발견되면 사례를 늘리세요. 작은 시험의 결과를 전사 효과로 바로 확대 해석하지 마세요.
시간이 줄지 않으면 AI 도입은 실패인가요?
시간 단축이 목표였다면 원인을 다시 봐야 합니다. 누락 감소나 응답 품질 개선처럼 다른 목표가 있다면 그것도 따로 측정하세요. 결과를 본 뒤 유리한 지표만 골라 성공으로 바꾸지는 마세요.