지난주에 나온 뉴스 하나가 며칠째 머릿속에 남아 있습니다. Devin을 만든 회사 Cognition이 9월 10일에 새 코딩 모델 SWE-2를 공개했는데, 자체 벤치마크에서 Claude Fable 5.1과 동급 점수를 내면서 비용은 64% 낮다고 발표했습니다. 여기까지는 흔한 "우리 모델이 더 싸고 좋다" 발표처럼 보입니다.
그런데 발표문을 읽다가 멈칫한 부분이 있었습니다. SWE-2는 Cognition이 바닥부터 만든 모델이 아닙니다. 중국 문샷AI가 만든 Kimi K3라는 오픈웨이트 모델을 가져다가, 그 위에 자기들 강화학습 방식을 한 겹 얹어서 만든 겁니다. 수천억 원짜리 GPU 클러스터로 파운데이션 모델을 처음부터 훈련한 게 아니라, 남이 만들어 놓은 것 위에 마지막 한 겹을 올려서 1등급에 붙었다는 얘기입니다.
저는 코딩을 못 하는 1인 기업 운영자입니다. 모델 훈련은커녕 모델이 어떻게 생겼는지도 모릅니다. 그런데 이 뉴스는 제 얘기처럼 읽혔습니다. 제가 매일 하는 일이 정확히 이 구조거든요. 오늘은 이 "얹기" 전략이 실제로 뭐고, AI 래퍼 수익화가 왜 대부분 실패하는지, 1인 기업이 어디까지 따라 할 수 있는지를 정리해 보겠습니다.

1. 1등급 코딩 AI를 만든 회사가 실제로 한 일
먼저 사실관계부터 정확히 봅시다. Cognition의 SWE-2는 문샷AI의 Kimi K3(2.8조 파라미터)를 베이스로 후처리 학습(post-training)해서 만든 모델입니다. Kimi K3는 이미 에이전트형 코딩을 위해 상당한 강화학습을 거친 상태였고, Cognition은 그 위에 자사 강화학습 레시피를 한 번 더 돌렸습니다.
- 자체 벤치마크 FrontierCode 1.1 Main에서 50.0% — Fable 5.1과 동급, SWE-1.7·Grok 4.6· GPT 5.6 Sol보다 높음
- 같은 성능을 내면서 비용은 64% 낮음
- DeepSWE 1.1 73.0%, Terminal-Bench 2.1 92.8%
- 자사 발표에 따르면 후처리만으로 여러 벤치마크에서 5~6점이 올라감
여기서 제가 주목한 건 "5~6점"입니다. 베이스 모델이 이미 90%의 일을 해놨고, Cognition이 얹은 건 마지막 5~6점이었다는 뜻이니까요. 그 마지막 한 겹이 "쓸 만한 모델"과 "돈 받고 파는 제품"을 갈랐습니다.
참고로 이 숫자들은 Cognition 자체 벤치마크 기준입니다. 자사 벤치는 자사에 유리하게 설계되기 마련이니, 마케팅 수치로 보고 읽는 게 맞습니다. 제가 여기서 가져가는 건 점수가 아니라 구조입니다.
2. 오픈웨이트 모델이 쏟아지면서 '바닥 재료값'이 무너졌습니다
이 전략이 갑자기 말이 되기 시작한 이유는 따로 있습니다. 얹을 수 있는 '바닥'이 거의 공짜가 됐거든요. 같은 주에 DeepSeek이 V4.1 Flash를 공개했습니다. 이쪽은 아예 MIT 라이선스 오픈웨이트로 허깅페이스에 올라갔습니다. 상업적 사용도, 재배포도, 파인튜닝도 매출 기준 없이 자유롭습니다.
- 552B 파라미터인데 토큰당 실제 활성화는 8B만 — 덩치는 크게, 연산은 싸게
- 컨텍스트 100만 토큰, 이미지 입력도 네이티브 지원
- 가격은 오프피크 기준 인풋 100만 토큰당 $0.15, 아웃풋 $0.60 (피크 시간대는 더 비쌉니다)
- 그리고 캐시 히트는 100만 토큰당 $0.003 (오프피크 기준, 피크는 $0.006)
마지막 줄을 다시 보세요. 0.003달러. 원화로 5원이 안 됩니다.
이게 저 같은 사람한테 무슨 의미냐면, 제 자동화 파이프라인은 매일 같은 시스템 프롬프트, 같은 브랜드 규칙, 같은 포맷 지시문을 반복해서 집어넣습니다. 그 반복되는 앞부분이 바로 캐시가 먹히는 구간입니다. 반복 작업 위주로 돌아가는 1인 기업 워크플로우는 이 가격 구조의 최대 수혜자예요.
정리하면, 재료는 싸지고 품질은 상향 평준화됐습니다. Kimi K3나 GLM 계열 같은 오픈웨이트 모델이 폐쇄형 최상위 모델과 성능 차이를 좁히면서, 경쟁의 무대가 "누가 좋은 모델을 가졌나"에서 "그 모델 위에 뭘 얹었나"로 완전히 옮겨갔습니다.
3. 그런데 AI 래퍼 수익화는 대부분 실패합니다 — 60~70%는 매출 0원
여기서 김을 좀 빼야 합니다. 저도 이 뉴스를 보고 신나서 "그래, 나도 얹는 쪽이지!"라고 생각했다가, 관련 자료를 찾아보고 조용해졌습니다.
2026년 기준으로 AI 래퍼(wrapper) 서비스의 60~70%는 매출이 0원이라는 분석이 있습니다. 이유는 명확합니다. 파운데이션 모델 회사들이 업데이트를 낼 때마다, 주변 스타트업이 만들어 둔 기능을 통째로 삼켜버리거든요. 지난달까지 내 서비스의 핵심 기능이었던 게 이번 달 모델 업데이트에 기본 탑재되는 일이 반복됩니다.
그래서 "얹었다"는 사실 자체는 아무것도 보장하지 않습니다. 갈리는 지점은 얹은 게 모델 회사가 기능 하나 출시해서 복사할 수 있는 것이냐, 아니냐입니다. 같은 자료들이 공통으로 짚는 방어 가능한 자산은 세 가지였습니다.
- 제품이 굴러가면서 스스로 만들어내는 데이터 — 남이 똑같이 만들려면 수백만 사용자가 필요한 종류
- 그 업무의 공식 기록 장부가 되는 것 — 워크플로우 자체를 소유하는 것
- 그 둘을 계속 보유할 수 있게 해주는 계약상 권리
Cognition이 얹은 5~6점도 이 관점에서 보면 단순한 파인튜닝이 아니었습니다. Devin을 굴리면서 쌓은 실제 코딩 에이전트 실행 데이터가 있으니까 그 후처리가 가능했던 거죠. 순서가 반대인 겁니다. 후처리를 잘해서 데이터가 생긴 게 아니라, 데이터가 있어서 후처리가 가능했습니다.
4. 그래서 1인 기업 버전의 '마지막 10%'는 무엇인가
저는 모델을 후처리할 수 없습니다. GPU도, 데이터셋도, 엔지니어도 없습니다. 그런데 위의 구조를 제 규모로 번역하면 할 수 있는 게 남습니다. 제가 실제로 하고 있는 세 가지입니다.
첫째, 프롬프트를 대화가 아니라 자산으로 쌓습니다. 잘 나온 결과물을 만들어낸 지시문은 채팅창에 버려두지 않고 파일로 저장해서 매번 같은 걸 다시 부릅니다. 제 브랜드 톤, 캡션 분량 규칙, 이미지 컨셉 스타일 같은 것들이요. 이건 모델이 바뀌어도 제 소유로 남습니다. 모델은 렌트고, 이건 제 재산입니다.
둘째, 실패 기록을 지우지 않습니다. 자동화가 이상한 결과를 뱉으면 그 케이스를 따로 모아둡니다. "이런 입력이 들어오면 이렇게 망가진다"는 목록이 쌓이면, 그게 제 워크플로우의 검수 기준이 됩니다. 모델 회사는 제 실패 목록을 갖고 있지 않습니다. 이게 제 규모에서 만들 수 있는 유일한 데이터 해자예요. 이런 지시문·실패기록·검수절차를 실제로 어떻게 쌓아왔는지는 AI 1인 기업 전자책에 사례로 정리해두고 있습니다.
셋째, 한 벤더에 파이프라인을 묶지 않습니다. 지난주에 최고였던 모델이 이번 주에 2등이 되는 속도가 지금 이 정도입니다. 그래서 "어느 모델을 쓰느냐"는 갈아 끼울 수 있는 부품으로 두고, 그 앞뒤의 지시문·검수 절차·출력 포맷을 제 쪽에 붙들어 둡니다. 갈아 끼우는 데 반나절 이상 걸린다면, 그건 제가 모델 회사에 종속된 상태라는 신호입니다.
정리하면 이렇습니다. 모델은 빌려 쓰는 것이고, 내 것으로 남기는 건 지시문·실패기록·검수절차입니다. Cognition이 Kimi K3 위에 5~6점을 얹은 자리에, 저는 제 브랜드 규칙과 실패 목록을 얹는 겁니다. 규모는 비교가 안 되지만 구조는 같습니다.
5. 얹는 쪽도, 얹히게 해주는 쪽도 돈을 법니다
마지막으로 이 이야기의 반대편도 봐야 공평합니다. SWE-2의 베이스가 된 Kimi를 만든 문샷AI는, 연환산 매출이 6월 3억 달러에서 8월 10억 달러를 넘겼고 연말 20억 달러를 목표로 잡았다고 밝혔습니다. 홍콩 상장도 준비 중이라고 보도됐죠.
흥미로운 건 성장 방식입니다. 문샷은 자기 챗봇 서비스만 판 게 아니라, 다른 회사가 자기 모델 위에 제품을 얹게 해주면서 매출을 키웠습니다. Cognition은 얹어서 벌고, 문샷은 얹히게 해줘서 법니다. 같은 한 겹에서 양쪽이 돈을 버는 구조입니다.
그럼 1인 기업은 어느 층위에 서야 할까요. 솔직히 저는 문샷이 될 수 없습니다. 그건 조 단위 자본의 게임이에요. 제가 설 수 있는 자리는 Cognition 쪽, 그것도 훨씬 좁은 버전입니다. 아주 좁은 문제 하나에 대해, 남의 모델 위에 내 규칙과 내 경험을 얹어서 파는 것.
넓힐수록 지고, 좁힐수록 삽니다. 범용 AI 도구는 모델 회사가 기본 기능으로 삼켜버리지만, "전자책을 파는 1인 창업가가 인스타 카드뉴스를 매일 만드는 워크플로우"처럼 좁은 문제는 아무도 기능 하나로 덮어주지 않습니다. 그건 그냥 시장이 너무 작아서 대기업이 안 오는 자리고, 1인 기업한테는 충분히 큰 자리입니다.
마무리 — 질문을 바꾸면 됩니다
이번 뉴스에서 제가 건진 문장은 하나입니다. 바닥부터 만들지 마세요. 마지막 한 겹만 내 것으로 만드세요.
Cognition은 2.8조 파라미터 모델을 만들지 않았습니다. 만들어진 걸 가져다가 5~6점을 얹었고, 그 5~6점으로 1등급 제품이 됐습니다. 오픈웨이트 모델이 쏟아지면서 재료값이 매년 무너지고 있는 지금, 이 구조는 점점 더 유리해지고 있습니다.
코딩 못 해도 됩니다. 모델 훈련 몰라도 됩니다. 대신 질문을 바꿔야 합니다. "어떤 AI를 써야 하지?"가 아니라 "내가 얹을 수 있는 한 겹은 뭐지?"입니다.
저한테 그 한 겹은 매일 쌓이는 지시문 파일과 실패 기록입니다. 화려하지 않고, 아무도 부러워하지 않고, 백업 폴더에 조용히 쌓입니다. 그런데 모델을 갈아 끼워도 그것만은 남더라고요. 오늘 잘 나온 결과물이 있다면, 그 지시문을 채팅창에서 꺼내서 파일로 한 번 저장해 보시길 권합니다. 거기서부터 시작입니다.
작성: Art Gourmet · SWE-2 성능 수치는 Cognition 자체 벤치마크(FrontierCode) 기준이며, 래퍼 매출 통계는 업계 추정치입니다.