개발 외주 견적은 오랫동안 화면 수로 냈습니다. 화면이 40개면 40개만큼, 관리자까지 붙으면 그만큼 더. 이 방식이 오래 통한 건 화면 하나에 들어가는 일이 대체로 비슷했기 때문입니다.
AI 기능은 이 전제를 깹니다. "문서를 자동으로 분류해 주세요"는 화면으로 치면 하나입니다. 업로드 버튼과 결과 목록. 그런데 실제로는 화면 스무 개짜리보다 오래 걸릴 수 있습니다.
기간을 정하는 건 화면이 아니라 정답률입니다
같은 "문서 분류"라도 이렇게 갈립니다.
| 어디에 쓰나 | 필요한 정확도 | 대략 기간 |
|---|---|---|
| 사람이 마지막에 확인하는 보조 도구 | 80% | 2~4주 |
| 확신 높은 것만 자동, 나머지는 사람 | 90% + 기준선 설계 | 6~10주 |
| 사람 확인 없이 바로 처리 | 98% 이상 | 3개월 이상, 혹은 불가 |
마지막 몇 퍼센트를 올리는 데 드는 시간이 앞의 80%를 만드는 시간보다 훨씬 깁니다. 90%에서 95%로 가는 비용이 0%에서 90%로 가는 비용과 비슷한 경우도 흔합니다.
견적서에 "AI 문서 분류"라고만 적혀 있으면 이 차이가 통째로 숨습니다. 그래서 같은 문장을 보고 어떤 회사는 2,000만 원, 어떤 회사는 8,000만 원을 씁니다. 둘 다 거짓말이 아닙니다. 서로 다른 걸 견적한 겁니다.
발주 전에 정해야 할 네 가지
하나. 틀리면 무슨 일이 생기나
이게 정확도 목표를 정하고, 정확도 목표가 기간을 정합니다.
- 잘못 분류된 문서를 다시 올리면 그만인가
- 돈이 잘못 나가나
- 규제에 걸리나
세 번째라면 자동화 자체를 다시 생각해야 할 수도 있습니다. "틀리면 어떻게 되는지"를 문서 첫 줄에 적어두면 나머지 논의가 전부 쉬워집니다.
둘. 판단 근거로 쓸 데이터가 지금 어떤 상태인가
"우리 데이터로 학습시켜 주세요"라는 말을 들으면 저희가 제일 먼저 묻는 게 그 데이터가 어떻게 쌓여 있느냐입니다.
괜찮은 상태 한 테이블 · 분류 컬럼 있음 · 입력 규칙 통일 · 1만 건 이상
곤란한 상태 엑셀 40개 · 담당자마다 기준 다름 · 오탈자 · 500건
아래라면 개발보다 데이터 정리에 시간이 더 듭니다. 그리고 그 정리는 외주사가 대신 못 합니다. 뭐가 맞는 분류인지는 그 일을 하는 사람만 압니다.
셋. 사람이 끼어들 자리를 어디에 둘 건가
전부 자동을 목표로 잡으면 비용이 몇 배가 됩니다. 대개 이 순서가 낫습니다.
1단계 AI가 제안 → 사람이 확정 (여기서 수정 이력이 쌓인다)
2단계 확신 높은 건 자동, 나머지 사람 (1단계 이력이 기준선을 알려준다)
3단계 전부 자동, 이상한 것만 사람
1단계를 건너뛰면 2단계 기준선을 감으로 잡게 됩니다. 그 감이 틀리면 사고는 사용자에게 바로 갑니다.
넷. 뭘 보고 "됐다"고 할 건가
제일 자주 빠지는 항목입니다. 기준 없이 시작하면 검수할 때 "생각한 거랑 다른데요"만 반복됩니다.
실제 데이터 50~100건에 사람이 정답을 붙인 시험지를 발주 전에 만들어야 합니다. 하루면 되고, 이게 있으면 검수가 하루 만에 끝납니다. 없으면 몇 주가 걸립니다.
한 번에 묶지 말고 단계로 끊으세요
AI는 만들어 보기 전에 정확도를 알 수 없습니다. 그래서 전체를 한 번에 정액으로 묶으면 개발사는 위험을 값에 얹고 발주사는 그 값을 냅니다. 서로 손해입니다.
| 단계 | 하는 일 | 기간 | 나오는 것 |
|---|---|---|---|
| 1 | 실제 데이터로 가능한 정확도 확인 | 2~4주 | 숫자와 실패 사례 목록 |
| 2 | 그 숫자로 범위·금액 다시 잡기 | 1주 | 확정 견적 |
| 3 | 구현과 운영 | — | — |
1단계에서 "이 데이터로는 목표에 못 간다" 는 결론이 나올 수도 있습니다. 그걸 4주 만에 아는 것과 6개월 뒤에 아는 것의 차이가 이 방식의 값어치입니다.
1단계는 값이 크지 않습니다. 데이터를 붙여 몇 가지를 재보는 일이고, 나오는 건 코드가 아니라 숫자와 판단 근거입니다.
운영비를 견적에 넣으셨나요
개발비만 보고 계약했다가 운영비에서 놀라는 일이 많습니다. AI는 쓸 때마다 돈이 나갑니다.
요청당 입력 8,000 토큰 + 출력 500 토큰
하루 2,000건, 한 달 6만 건
입력 8,000 × 60,000 = 4.8억 토큰
출력 500 × 60,000 = 0.3억 토큰
여기에 모델 단가를 곱하면 월 운영비가 나옵니다. 이 계산을 견적 단계에서 같이 해야 합니다. 캐싱을 켜느냐, 어떤 모델을 쓰느냐에 따라 몇 배가 달라지는데 그건 설계할 때 정해집니다. 나중에 바꾸려면 구조를 다시 짜야 하고요.
유지보수 조건을 계약서에 넣으셨나요
AI 기능은 넘겨받은 다음이 특히 어렵습니다. 코드만 봐서는 왜 그 프롬프트 문장이 들어갔는지, 왜 기준값이 0.72인지 알 수 없습니다.
계약서나 산출물 목록에 이게 들어 있는지 확인하세요.
- 프롬프트 변경 이력과 각 변경의 이유
- 정확도 평가 세트 (질문과 정답 묶음)
- 기준값을 그렇게 잡은 실험 기록
- 쓴 모델과 버전, 고정 여부
없으면 다음 사람이 손을 못 대고, 못 대면 기능은 그대로 굳었다가 결국 통째로 다시 만들게 됩니다.
정리
AI 기능 견적은 만들 화면이 아니라 틀렸을 때 감당할 수 있는 범위에서 나옵니다.
문의하실 때 "뭘 자동화하고 싶은지"와 함께 이 셋을 알려주시면 훨씬 정확한 답을 드릴 수 있습니다.
- 틀리면 어떻게 되는지
- 판단 근거로 쓸 데이터가 지금 어떤 형태인지
- 사람이 확인하는 단계를 둘 수 있는지
세 번째가 "된다"면 대부분의 프로젝트는 생각보다 빠르고 싸게 끝납니다.
