AI를 동업자로 고용해 1인 회사를 만들고 있다고 계속 써왔는데, 이 동업자한테는 월급 명세서가 없습니다. 대신 요금 청구서가 있죠.
처음 몇 달은 신경도 안 썼습니다. 월 구독료 얼마로 사람 한 명 몫을 한다니 이보다 싼 게 어딨나 싶었고요. 그런데 자동화를 하나씩 붙이고, 매일 도는 작업이 늘고, AI가 혼자 파일을 읽고 판단하고 다시 쓰기 시작하면서 숫자가 조용히 올라가더군요. 사용량 한도 경고를 보고서야 "이게 대체 어디서 새는 거지?" 하고 처음 들여다봤습니다.
들여다보고 알게 된 건 좀 뜻밖이었습니다. 제가 돈을 많이 쓴 이유는 AI한테 일을 많이 시켜서가 아니었습니다. 같은 걸 반복해서 보내고, 실패한 작업을 다시 돌리느라 쓴 돈이 훨씬 컸어요. 그래서 오늘은 AI 비용 절감을 코딩 모르는 1인 창업가 기준으로 정리해보려 합니다. 나오는 숫자는 전부 공식 가격 문서에서 확인한 것만 썼고, 출처가 약한 건 약하다고 밝히겠습니다.

1. 왜 AI 에이전트는 챗봇보다 돈을 훨씬 많이 먹을까
구조부터 보겠습니다. 이걸 모르면 나머지가 다 안 와닿습니다.
AI에게 말을 걸면 요금은 토큰이라는 단위로 매겨집니다. 대충 한국어 한 글자가 토큰 하나쯤 된다고 생각하시면 감이 맞습니다. 내가 보낸 글(입력)과 AI가 써준 글(출력)에 각각 값이 매겨지고, 출력이 입력보다 다섯 배쯤 비쌉니다. 예를 들어 오퍼스 5는 100만 토큰당 입력 5달러, 출력 25달러입니다.
여기까지는 단순합니다. 문제는 에이전트예요.
챗봇은 한 번 묻고 한 번 답하면 끝입니다. 그런데 에이전트는 혼자 일합니다. 파일을 읽고, 생각하고, 도구를 부르고, 결과를 보고, 다시 판단하고… 이 과정이 한 번의 '작업'을 끝내기까지 열 번 스무 번 반복됩니다. 그리고 여기가 핵심인데, 에이전트는 매 턴마다 지금까지의 대화 전체를 다시 보냅니다.
AI에게는 기억이 없습니다. 매번 "여태까지 우리가 한 얘기는 이겁니다"를 통째로 다시 들려줘야 다음 판단을 할 수 있어요. 그래서 10턴짜리 작업은 1턴짜리의 10배가 아닙니다. 1턴째는 대화 하나, 2턴째는 대화 둘, 3턴째는 대화 셋… 누적으로 쌓이니까요. 정확히 몇 배인지는 작업마다 다르지만, 누적 재전송이라는 구조만 기억하시면 됩니다.
여기서 바로 실전 교훈 하나가 나옵니다. AI에게 들려주는 배경 자료를 무작정 많이 넣는 건 한 번 비싼 게 아니라 매 턴 비쌉니다. "혹시 몰라서" 넣어둔 문서 한 뭉치가 작업 내내 따라다니면서 요금을 먹는 거예요. 에이전트를 여러 개 굴릴 때 이 비용이 어떻게 곱해지는지는 지난 8월 23일 멀티 에이전트 글에서 따로 다뤘습니다.
2. AI 비용 절감법 3가지 — 각각 다른 낭비를 잡습니다
① 프롬프트 캐싱 — 반복해서 보내는 걸 싸게
매번 똑같이 들어가는 부분이 있습니다. 시스템 지침, 도구 설명, 회사 소개, 브랜드 톤 가이드 같은 것들이요. 안 바뀌는데도 매 요청마다 처음부터 다시 처리됩니다.
캐싱은 "이 앞부분은 아까 처리한 그대로니까 저장해뒀다 재사용하자"는 기능입니다. 효과가 꽤 셉니다. 공식 가격 기준으로 캐시에 저장할 때는 기본가의 1.25배(5분 보관) 또는 2배(1시간 보관)를 내지만, 캐시에서 읽을 때는 기본 입력가의 0.1배입니다. 반복 구간에서 10분의 1로 떨어지는 셈이죠.
다만 조건이 둘 있습니다. 첫째, 반복되는 앞부분이 글자 하나까지 똑같이 유지돼야 캐시가 맞습니다. 캐시를 깨뜨리는 대표적인 습관은 이렇습니다.
- 프롬프트 맨 앞에 현재 시각이나 요청 번호를 넣는 것 (매번 달라지니 그 뒤가 전부 무효)
- 도구 목록의 순서를 바꾸는 것
- 중간에 모델을 바꾸는 것
그래서 권장 구조는 안 변하는 것 → 자주 변하는 것 순서입니다. 지침과 자료는 앞에, 오늘의 질문은 뒤에. 코딩 몰라도 이건 할 수 있습니다.
둘째, 앞부분이 일정 길이를 넘어야 캐시가 걸립니다. 오퍼스 5 기준 512토큰인데, 그보다 짧으면 에러도 경고도 없이 그냥 캐시가 안 됩니다. "캐싱 켰는데 왜 안 싸지지?"의 꽤 흔한 원인이라 알아두시면 좋습니다.
② '지침 부채' 청소 — 예전 AI 때문에 붙여둔 잔소리 걷어내기
이게 제일 뜨끔했던 부분입니다.
우리는 AI가 실수할 때마다 프롬프트에 한 줄씩 덧붙입니다. "반드시 두 번 검증해라", "단계별로 생각해라", "이런 형식으로 먼저 정리한 다음에 답해라". 당시엔 다 필요했던 처방이죠.
그런데 모델을 새 걸로 갈아탄 뒤에도 그 잔소리가 그대로 남아 있습니다. 앤트로픽은 이걸 '지침 부채'라고 부릅니다. 이제 안 시켜도 알아서 하는 걸 굳이 시키는 바람에, 불필요한 추론과 도구 호출이 생겨서 비용은 올라가고 성능은 오히려 떨어지는 상황이 된다는 겁니다.
앤트로픽이 공개한 실측에서는 고객지원용 프롬프트에 이런 안티패턴을 심어놓고 정리했더니 평균 비용 14.6% 감소, 정확도 5.3% 향상이 나왔습니다. 다만 앤트로픽 스스로 "특정 조건의 테스트라 모든 앱에 그대로 적용되진 않는다"고 못을 박았으니, 이 숫자는 방향 참고용으로만 보는 게 맞습니다.
제 경우엔 매일 도는 자동화 프롬프트들이 몇 달치 잔소리로 부풀어 있었습니다. 한번 열어보시길 권합니다. 지금 모델이 정말 그 지시 없이는 못 하는지 확인해보면, 걷어낼 게 생각보다 많습니다.
③ '노력 수준' 조정 — 모든 일에 최고 두뇌를 쓰지 않기
요즘 모델들은 답하기 전에 얼마나 깊이 생각할지를 조절할 수 있습니다. 앤트로픽이 공개한 수치가 아주 정직한데, 노력 수준을 최저에서 최고로 올렸더니 정답률은 19.4%포인트 올라갔고, 작업당 비용은 약 3.5배 늘었습니다. (이것도 앤트로픽 자체 테스트 조건 기준입니다.)
이 숫자를 어떻게 읽어야 할까요. "그럼 무조건 낮춰야지"가 아닙니다. 중요한 건 일마다 필요한 깊이가 다르다는 겁니다. 인스타 캡션 문장 다듬기에 3.5배를 쓸 이유는 없고, 반대로 결제 로직이나 고객 응대 정책을 짜는 데 최저 수준을 쓰면 검증을 건너뛴 답이 나옵니다.
흥미로운 건 좋은 모델에 낮은 노력 수준을 주는 게, 싼 모델에 높은 노력 수준을 주는 것보다 가성비가 나은 경우가 있다는 점입니다. "비싸니까 하위 모델로 갈아타자"가 항상 정답은 아니라는 거죠. 모델 등급과 사고 깊이는 따로 노는 두 개의 손잡이고, 같이 돌려봐야 합니다.
3. 코딩 몰라도 오늘 할 수 있는 5가지
여기까지 읽고 "그래서 나는 뭘 하지" 싶으실 테니, 제가 실제로 돌려본 것 중 코드 없이 되는 것만 추립니다.
① 반복 프롬프트를 '고정 부분 먼저' 순서로 다시 짠다. 브랜드 톤, 출력 형식, 지시사항을 위쪽에 고정해두고 그날의 재료만 아래에 갈아끼우세요. 캐싱은 이 구조에서만 작동합니다.
② 프롬프트에서 잔소리를 걷어낸다. 지금 쓰는 지시문을 열어서 "이거 없으면 정말 못 하나?"를 한 줄씩 물어보세요. 특히 모델을 갈아탄 뒤로 한 번도 안 고친 프롬프트가 1순위입니다.
③ 일의 등급을 나눈다. 문장 다듬기·분류·요약 같은 단순 작업과, 전략 판단·코드·돈 다루는 작업을 구분하세요. 앞쪽은 싼 모델이나 낮은 노력 수준으로 충분합니다.
④ 급하지 않은 일은 몰아서 돌린다. 배치 처리(Batch API)로 비동기로 묶어 보내면 입력·출력 모두 50% 할인입니다. 당장 답이 필요 없는 대량 작업 — 글 100개 분류, 이미지 캡션 일괄 생성 같은 것 — 이라면 절반 가격이에요.
⑤ 요금제는 "몇 배"가 아니라 "어떤 단위로 걸리는지"를 본다. 구독제를 쓰신다면 광고 문구의 배수보다 한도가 걸리는 단위를 확인하세요. 시간당인지, 몇 시간짜리 세션 단위인지, 주간인지. 하루에 몇 번 몰아서 작업하는 패턴이면 세션 한도에 먼저 걸리고, 종일 조금씩 쓰는 패턴이면 주간 한도에 걸립니다. 같은 요금제라도 내 작업 리듬에 따라 체감이 완전히 달라집니다.
다섯 개 중 넷은 오늘 오후에 할 수 있는 일입니다. 이런 식으로 AI를 회사처럼 굴리는 구조 전체를 정리한 내용은 AI 1인 기업 전자책에 담아뒀습니다.
마무리: 아껴야 할 건 토큰이 아니라 '재시도'
비용을 볼 때 토큰 단가가 아니라 '성공적으로 작업을 끝내는 데 든 비용'을 봐야 합니다. 입력·출력 토큰뿐 아니라 생각하는 데 쓴 토큰, 도구 호출, 기다린 시간, 오류와 재시도, 실제 성공률까지 다 합쳐서요.
이 관점으로 바꾸고 나니 제 판단이 달라졌습니다. 예전엔 "이 모델이 비싸니까 싼 걸로 바꿔볼까"였는데, 지금은 "이 작업은 한 번에 끝나는가"를 먼저 봅니다. 싼 모델로 네 번 다시 돌리는 것보다 비싼 모델로 한 번에 끝내는 게 싼 경우가 정말 많았습니다. 특히 1인 기업은 재시도할 때마다 토큰만 나가는 게 아니라 제 시간도 같이 나가니까요. 그 시간은 요금표에 안 찍히지만 제일 비싼 항목입니다.
결국 AI 비용 절감이란 이 동업자에게 일을 잘 설명하는 법을 익히는 일이었습니다. 지시를 명확히 쓰는 30초가 토큰 최적화 30분보다 돈을 더 아낍니다. 이건 코딩이 아니라 커뮤니케이션이고, 그래서 코딩 모르는 사람도 잘할 수 있는 영역입니다.
이번 달 청구서가 지난달보다 늘었다면, 오늘 프롬프트 파일 하나만 열어보세요. 아마 몇 달 전의 내가 붙여둔 잔소리가 아직 거기 있을 겁니다.
작성: Art Gourmet · 토큰 단가(오퍼스 5 기준 100만 토큰당 입력 $5 / 출력 $25), 캐시 쓰기 1.25배·2배 및 읽기 0.1배, 캐시 최소 길이 512토큰, 배치 처리 50% 할인은 클로드 플랫폼 공식 가격·캐싱 문서 기준입니다. 비용 14.6% 감소·정확도 5.3% 향상, 노력 수준에 따른 정답률 19.4%포인트·비용 3.5배 수치는 앤트로픽이 공개한 자체 테스트 결과이며, 앤트로픽 본인이 특정 조건의 실험임을 명시했습니다.