← 인사이트 목록으로
2026.10.01

새 AI 모델 나올 때마다 갈아타야 할까 — 제미나이 4 아르곤 공개 날, 저희가 모델을 바꾸는 기준 4가지

글 · Art Gourmet — David와 Hara, AI 에이전트 크루가 함께 회사를 실제로 운영하며 남기는 기록입니다. 팀 소개 →

오늘 아침 AI 뉴스는 하나로 모였습니다. 구글이 새 플래그십 모델 '제미나이 4 아르곤'을 공개했다는 소식입니다. 한 번에 써낼 수 있는 출력 분량이 기존 6만 4천 토큰에서 100만 토큰으로 늘었고, 코딩·기업 업무·사이버 보안 쪽 성능을 크게 앞세웠습니다. 이런 날이면 꼭 같은 질문이 따라옵니다. "새 AI 모델 나왔는데, 지금 쓰는 거 바꿔야 하나?"

저희는 AI 크루와 함께 콘텐츠, 앱, 트레이딩 봇까지 여러 일을 굴리는 작은 회사입니다. 그래서 모델을 실제로 바꿔본 적도, 바꿨다가 낭패를 본 적도 있습니다. 오늘은 제미나이 4 아르곤 기사에서 확인한 사실과, 저희가 그동안 모델을 교체하며 정리한 AI 모델 교체 기준 네 가지를 나란히 놓아 보겠습니다.

골든옐로우 톤의 추상 배경 — 두 개의 원이 겹쳐 있는 이미지, 두 모델을 나란히 견주는 느낌

1. 제미나이 4 아르곤, 기사에서 확인된 것만 추려보면

ZDNet Korea 보도에 따르면 구글은 현지 시각 9월 30일 공식 블로그로 제미나이 4 아르곤을 공개했습니다. 눈에 띄는 점은 세 가지입니다.

첫째, 아직 아무나 쓸 수 없습니다. 먼저 '페어윈드 프로그램'에 참여하는 일부 사이버 보안 방어 담당자에게 제공하고, 초기 평가를 바탕으로 안전장치를 보완한 뒤 개발자와 기업, 일반 소비자로 넓힐 계획이라고 합니다. 오늘 당장 갈아타고 싶어도 갈아탈 수 없는 모델이라는 뜻이죠.

둘째, 가격이 공개됐습니다. 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러입니다. 출력 한도가 100만 토큰으로 커졌다는 건, 반대로 말하면 한 번의 요청이 길게 써질수록 요금도 그만큼 커질 수 있다는 뜻이기도 합니다.

셋째, 안전장치를 함께 이야기했습니다. 악용 방지와 프롬프트 인젝션 대응을 강화했다고 밝혔는데, 일반 공개를 미룬 이유도 같은 맥락입니다. 성능이 좋아질수록 "얼마나 잘하나"만큼 "잘못 쓰이면 어떻게 되나"가 중요해진다는 신호로 읽힙니다.

2. 저희가 실제로 모델을 바꿨던 날

지난 8월, 저희 트레이딩 연구용 봇의 '최종 결재' 역할을 하던 모델은 구글의 클라우드 Gemini 모델이었습니다. 하루에 96번씩 호출되고 있었죠. 그러다 예상하지 못한 클라우드 요금 청구를 발견했고(무료 크레딧의 함정 글에 그 경위를 적었습니다), 그 자리를 내 컴퓨터에서 돌아가는 무료 로컬 모델(qwen2.5 7B)로 바꿨습니다.

결과는 반반이었습니다. 좋은 쪽으로는, 외부 서버를 오가지 않으니 봇이 한 바퀴 판단을 도는 시간이 8분에서 52초로 줄었고, 호출 요금도 사라졌습니다. 나쁜 쪽으로는, 작은 모델이 프롬프트에 예시로 적어둔 숫자를 그대로 베껴서 답했습니다. 비트코인 가격과 전혀 맞지 않는 손절 가격을 세 번 연속 내놓은 거죠. 결국 "답이 현재 가격과 앞뒤가 맞는지"를 확인하는 검사를 따로 붙였고, 맞지 않으면 아예 거래하지 않도록 했습니다. 이 검사는 어떤 모델을 쓰든 필요한 안전망이라는 걸 그때 배웠습니다.

3. '지원한다'는 말과 '실제로 된다'는 다릅니다

또 한 번은 사진을 읽어주는 로컬 모델을 고를 때였습니다. 새로 나온 한 모델은 설정 정보에 분명히 '이미지 인식 지원'이라고 적혀 있었습니다. 그런데 막상 사진을 넣어보니, 모델에게는 이미지가 새까만 화면으로 도착하고 있었습니다. 더 무서운 건 그다음이었습니다. 한 모델은 "안 보인다"고 솔직히 말했지만, 다른 모델은 "어둡고 추상적인 패턴"이라며 그럴듯한 설명을 지어냈습니다. 흰 바탕에 빨간 원을 넣어도 같은 답이었죠.

만약 정답을 아는 사진으로 먼저 시험해보지 않았다면, 수천 장의 사진에 틀린 설명이 그대로 붙었을 겁니다. 그래서 지금은 실제로 정상 동작이 확인된 다른 모델을 씁니다. 새 모델 발표문에 적힌 숫자가 아무리 좋아도, 우리 일에서 실제로 되는지는 우리가 직접 확인해야 합니다.

4. 새 AI 모델이 나왔을 때 저희가 따지는 기준 4가지

① 지금 막힌 게 '성능'인가? 바꾸고 싶은 이유가 "더 좋다니까"라면 일단 멈춥니다. 지금 모델로 실제로 못 하고 있는 일이 있을 때만 교체를 검토합니다. 저희가 모델을 바꾼 이유는 대부분 성능이 아니라 비용과 안정성이었습니다.

② 정답을 아는 시험지 10개로 먼저 돌려본다. 우리 업무에서 정답을 이미 아는 사례 열 개쯤을 모아 두고, 새 모델과 지금 모델에 똑같이 넣어 비교합니다. 발표된 벤치마크 점수는 남의 시험 점수입니다. 우리 시험지에서 몇 점인지가 진짜 기준입니다.

③ 요금은 '단가 × 실제 호출 횟수'로 계산한다. 100만 토큰당 몇 달러라는 숫자만 보면 싸 보이지만, 하루 96번처럼 자동으로 반복되는 작업에 붙이면 금방 커집니다. 요금 구조를 정리하는 방법은 AI 비용 절감 정리 글에 따로 적어두었습니다.

④ 갑자기 막혔을 때 갈아탈 길을 남겨둔다. 지난 9월 20일, 저희가 쓰던 무료 이미지 생성 서비스가 예고 없이 유료로 바뀌었습니다. 에러 메시지는 엉뚱하게 '서버 오류'라고만 했죠 (에러 메시지가 거짓말한 날). 그날 일이 멈추지 않았던 건, 내 컴퓨터에서 직접 배경 이미지를 그리는 대체 경로가 있었기 때문입니다. 새 모델로 갈아타더라도, 한 회사의 한 모델에만 모든 걸 걸지 않는 것. 이게 작은 회사가 할 수 있는 가장 싼 보험입니다.

마무리 — 바꾸는 속도보다 확인하는 습관

제미나이 4 아르곤은 분명 큰 발표입니다. 일반 공개가 되면 저희도 '정답 아는 시험지'에 넣어볼 생각입니다. 다만 그 결과를 보고 결정하지, 발표 당일의 열기로 결정하지는 않으려 합니다. 새 AI 모델은 앞으로도 몇 주 간격으로 계속 나올 테니까요. 모델을 빨리 바꾸는 회사보다, 바꿔도 흔들리지 않는 회사가 오래 갑니다.

저희가 AI 크루와 회사를 꾸리며 겪은 시행착오는 「AI 회사를 만들었습니다 -실전편-」 전자책에 더 자세히 담아 두었습니다. 어떤 일을 AI에게 맡기고, 어디서 사람이 확인해야 하는지 고민 중이시라면 참고가 될 거예요.

작성: Art Gourmet · 참고: ZDNet Korea, "구글, 업무·보안 강화한 '제미나이 4 아르곤' 공개…'안전장치 보완 중'"(2026.10.1). 본문의 모델 정보는 원문에서 확인한 부분만 담았습니다.

#제미나이4아르곤#AI모델교체기준#로컬AI모델#AIAPI비용#AI도입체크리스트
← 다른 인사이트 보기우리가 만든 도구들 구경하기 →