← 인사이트 목록으로
2026.09.23

AI 업무 분담표는 3개월이면 낡습니다 — AI에게 어디까지 맡길지 다시 재보는 법

글 · Art Gourmet — David와 Hara, AI 에이전트 크루가 함께 회사를 실제로 운영하며 남기는 기록입니다. 팀 소개 →

오늘 검색어에 GPT-6 Sol이 올라와 있더군요. 새 모델 발표 소식이었고, 같은 날 다른 회사의 새 모델 발표도 나란히 걸려 있었습니다. 저는 이런 날 성능 비교표를 열어보지 않습니다. 대신 다른 걸 엽니다. 제 업무 분담표요.

1인 기업을 운영하면서 AI에게 일을 맡기다 보면 자연스럽게 분담표가 생깁니다. 이건 AI가 하고, 이건 내가 하고, 이건 AI가 해놓으면 내가 확인하고. 문제는 이 표를 한 번 만들고 그대로 쓴다는 겁니다. 저도 그랬습니다. 반년 전에 "이건 AI가 못 하더라"고 판정한 일들을, 그 뒤로 한 번도 다시 시켜보지 않고 계속 제 손으로 하고 있었습니다.

그래서 오늘은 AI에게 어디까지 맡길지를 처음 정하는 이야기가 아니라, 이미 정해둔 분담표를 언제 다시 재느냐는 이야기를 하려 합니다. 기준을 어떻게 세우는지는 지난번에 '맡겨도 되는 일 vs 내가 확인하는 일'로 한 번 정리했으니 반복하지 않겠습니다. 오늘은 그 기준의 유통기한 이야기입니다.

골든옐로우 톤의 추상 배경 — 경계선이 시간에 따라 이동하는 구조를 상징하는 이미지

1. 먼저, 선이 얼마나 빨리 움직이는지

AI 평가 기관 METR은 조금 특이한 방식으로 성능을 잽니다. 시험 점수가 아니라 "사람이 이 일을 하는 데 몇 시간 걸리는가"를 기준으로, AI가 혼자 끝까지 해내는 일의 길이를 봅니다. 이걸 '시간 지평'이라고 부릅니다. 쉽게 말하면 "AI가 사람 손을 안 빌리고 버티는 시간"입니다.

이 숫자가 두 배가 되는 데 걸리는 기간이, 한동안은 약 7개월로 알려져 있었습니다. 그런데 2026년 1월에 갱신된 측정에서는 2023년 이후 구간의 배증 주기가 약 130일, 그러니까 4개월 남짓으로 계산됐습니다. 벤치마크에 더 긴 과제를 추가하고 결함 있는 과제를 걷어낸 뒤 다시 잰 값입니다.

숫자를 외울 필요는 없습니다. 실무자에게 필요한 건 한 문장뿐입니다. "반년 전에 안 되던 건, 지금 다시 시켜볼 가치가 있다." 체감으로도 맞습니다. 1년 전에는 AI에게 일을 시키면 서너 단계 지나 길을 잃었는데, 지금은 아침에 던져놓고 점심에 보면 열몇 단계를 밟아 결과물을 만들어둡니다. 그런데도 제 머릿속 분담표는 1년 전 버전이었던 거죠.

2. 그렇다고 통째로 맡기면 안 되는 이유 — 아직 16%입니다

그럼 이제 다 넘겨도 되냐. 여기서 숫자가 확 꺾입니다.

Scale AI와 CAIS(AI안전센터)가 만든 원격 노동 지수(Remote Labor Index)라는 평가가 있습니다. 접근이 아주 현실적입니다. 시험 문제를 푸는 게 아니라, 실제로 프리랜서에게 돈 주고 발주됐던 프로젝트 240건을 그대로 AI에게 던집니다. 채점 기준도 "도움이 됐는가"가 아니라 "클라이언트가 이 납품물을 받아줄 수준인가"이고, 사람이 직접 채점합니다.

결과는 2025년 10월 기준 2.5%였습니다. 100건 중 두세 건만 납품 수준이었다는 뜻입니다. 그리고 2026년 7월에는 이 수치가 16.1%가 됐습니다.

이 두 숫자는 같이 봐야 합니다. 9개월 만에 여섯 배는 무서운 속도입니다. 동시에 지금 이 순간의 절대값은 16%, 즉 열 건을 통째로 맡기면 여덟 건은 사람 손이 다시 필요하다는 뜻이기도 합니다. 그래서 저는 "맡길까 말까"를 묻지 않습니다. "이 일의 어느 구간까지 맡기고, 내가 어디서 받을까"를 묻습니다. 통째로 넘기는 건 아직 도박이지만, 구간을 쪼개면 승률이 완전히 달라지거든요. 참고로 이렇게 쪼갠 구간을 여러 번 이어 붙일 때 성공률이 어떻게 깎여나가는지는 '복합 오류의 수학' 편에서 계산해둔 적이 있습니다.

골든옐로우 톤의 추상 배경 — 분기마다 다시 측정하는 반복 구조를 상징하는 이미지

3. AI에게 어디까지 맡길지 다시 재보는 법 — 분기 30분 루틴

제가 실제로 쓰는 방식입니다. 거창하지 않습니다. 분기에 한 번, 30분이면 끝납니다.

① 안 되던 일을 적어두기부터 시작합니다. 이게 사실 전부입니다. AI에게 시켰다가 실패해서 제가 도로 가져온 일이 생기면, 그 자리에서 한 줄 적어둡니다. "무슨 일을, 어떤 식으로 시켰고, 어디서 깨졌는지." 적어두지 않으면 재시험할 목록 자체가 안 남습니다. 저는 이 기록을 안 해서 반년을 날렸습니다.

② 분기 첫 주에 그 목록에서 세 개만 뽑습니다. 전부 다시 해볼 필요 없습니다. 기준은 "되면 내 시간을 제일 많이 아껴주는 것" 순입니다.

③ 그때와 같은 조건으로 다시 시킵니다. 이게 중요합니다. 프롬프트를 새로 다듬어서 시키면 "모델이 좋아진 건지 내가 잘 쓴 건지"를 구분할 수 없습니다. 예전 지시문 그대로 넣고, 결과만 비교합니다.

④ 넘어온 일은 한 칸씩만 올립니다. 되더라도 곧장 무인 자동화로 보내지 않습니다. '내가 함' → 'AI가 초안, 내가 검수' → 'AI가 하고 결과만 보고' 순으로 한 칸씩입니다. 그리고 최소 일주일은 매일 눈으로 확인합니다. 제 파이프라인들은 대부분 첫날이 아니라 3~5일째에 처음 깨졌습니다. 첫날 성공은 아무것도 증명하지 않습니다.

지난 분기에 이 루틴을 돌렸을 때, 세 개 중 두 개가 넘어왔습니다. 반년 전에 "아직 무리"라고 접어뒀던 일들이었는데, 다시 시켜보니 그냥 됐습니다. 그동안 제가 손으로 하고 있었던 거죠.

4. 재시험해도 절대 안 넘기는 칸

반대쪽도 분명히 해두겠습니다. 성능이 아무리 올라가도 저는 한 칸을 안 뺍니다. 되돌릴 수 없는 행동입니다.

초안 작성은 마음에 안 들면 지우면 그만입니다. 그런데 외부로 나가는 것 — 게시, 발송, 결제, 삭제 — 은 되돌릴 수 없습니다. 잘못 나간 게시물 하나를 수습하는 비용은 모델 성능과 무관하게 비쌉니다. 16%든 60%든 그 비용은 그대로입니다. 그래서 이 앞에는 사람 확인을 하나 둡니다.

정리하면 분기 재시험의 대상은 'AI가 얼마나 잘하느냐'에 달린 일이고, 재시험 대상이 아닌 건 '실패하면 무슨 일이 벌어지느냐'에 달린 일입니다. 전자는 선이 계속 움직이고, 후자는 안 움직입니다.

마무리 — 연휴가 재점검하기 좋은 이유

곧 추석입니다. 저는 연휴를 이 재점검에 씁니다. 이유는 단순합니다. 연휴는 사람이 제일 오래 안 보는 구간이거든요. 평소에 안 깨지던 자동화가 연휴에 조용히 멈춰 있다가 나흘 뒤에 발견되는 일이 실제로 있었습니다. 그래서 연휴 직전에는 "뭘 더 맡길까"보다 "지금 맡겨둔 것 중에 내가 안 보면 위험한 게 뭐지"를 먼저 봅니다. 그러고 나서 남는 시간에 실패 목록을 꺼내 세 개를 재시험합니다.

오늘 딱 하나만 하신다면 ①번을 권합니다. AI에게 시켰다가 실패해서 도로 가져온 일을 한 줄씩 적어두는 것. 오늘부터 적으면 다음 분기에 재시험할 목록이 생깁니다. 지금 아무것도 안 적혀 있다면, 다음 분기에도 "뭐가 안 됐더라"에서 막힙니다.

코딩을 못 해도 이건 할 수 있습니다. 업무 순서를 바꾸는 일이지 개발이 아니니까요. 이런 식으로 1인 AI 회사의 분담표와 자동화를 하나씩 쌓아 올린 과정은 「AI 회사를 만들었습니다 -실전편-」에 정리해뒀습니다.

작성: Art Gourmet · 시간 지평 배증 주기는 METR이 2026년 1월 공개한 갱신값(2023년 이후 구간 기준)이며, 원격 노동 지수 수치는 2025년 10월 2.5%, 2026년 7월 16.1% 기준입니다. 본문의 분기 재시험 루틴과 실패 목록 사례는 2026년 자사 자동화 운영 중 직접 정리한 내용입니다.

#AI업무분담재점검#AI에게어디까지맡길까#에이전트성능지표읽는법#GPT-6Sol#1인기업분기루틴
← 다른 인사이트 보기우리가 만든 도구들 구경하기 →