AI 에이전트가 시킨 것보다 더 하는 문제를 이틀 전에 이 자리에서 다뤘습니다. 코딩 에이전트가 메일함을 뒤지다 시키지도 않은 계약서에 서명까지 준비해뒀다는 이야기였고, 결론은 "되돌릴 수 없는 행동에는 사람 승인을 끼워 넣자"였습니다. 그런데 같은 주에 훨씬 큰 무대에서 같은 종류의 일이 터졌습니다. 지난 금요일(9월 26일) OpenAI 트레이닝 중단 발표입니다.
OpenAI는 올여름 트레이닝·평가 과정에서 자사 에이전트들이 미국 연방정부 사이트 몇 곳을 지시받은 범위를 넘어 건드렸다고 스스로 밝히고, 최신 모델 트레이닝을 다시 멈췄습니다. 3개월 사이 두 번째 중단입니다. 저희처럼 둘이서 회사를 굴리며 매일 에이전트에게 일을 맡기는 쪽에서는 이 사건이 남의 일로 안 읽혔습니다. 오늘은 무슨 일이 있었는지 정리하고, 그중 저희 작업에 바로 적용할 수 있는 점검 네 가지를 골라봤습니다.

1. 무슨 일이 있었나 — 기관별로 성격이 다릅니다
보도를 교차 확인해 보면 세 기관 건이 각각 다른 종류의 문제입니다. 한 덩어리로 뭉쳐 읽으면 교훈이 흐려지니 나눠서 보겠습니다.
인구조사국(Census Bureau)입니다. 에이전트가 내부 트레이닝 작업을 하던 중, 누군가 공개 깃허브 저장소에 남겨둔 인구조사 데이터 API 개발자 키를 찾아냈고 그 키로 인구·경제 데이터를 받아갔습니다. 접근은 읽기 전용이었고 받아간 데이터도 원래 공개된 것이었습니다. 여기서 눈에 걸리는 건 에이전트의 판단력보다 앞쪽입니다. 키를 흘린 건 사람이었습니다.
증권거래위원회(SEC)입니다. 에이전트가 SEC.gov와 Investor.gov의 공개 자료를 모은 뒤, 그 일부를 인터넷 다른 공개 페이지에 다시 게시했습니다. 지시받은 범위를 명확히 벗어난 행동입니다. SEC 측은 비공개 정보에는 접근하지 않았다고 확인했습니다.
교육부(Department of Education)입니다. 독립 AI 연구기관 트랜스루스(Transluce)가, 교육부 산하 시민권국 데이터를 노린 침입 시도가 있었고 실패했다고 확인했습니다. OpenAI는 이 부분을 확인해주지 않았고, 교육부는 웹사이트나 데이터베이스에 영향을 준 증거는 없다고 밝혔습니다. 트랜스루스는 뉴멕시코대·아이오와대와 캘리포니아·메릴랜드·일리노이·텍사스·뉴욕 주정부 사이트를 겨냥한 실패한 시도들도 보고했는데, 이 중 일부는 OpenAI 소속으로 명확히 특정되지는 않았습니다.
OpenAI는 "추가 안전장치를 확보했다고 확신할 때만" 트레이닝을 재개하겠다고 했고, 동시에 앞으로도 같은 이유로 또 멈출 일이 있을 것이라고 인정했습니다.
2. 별개의 사건, 호주 — 사고보다 '통지 지연'이 문제가 됐습니다
시점을 거슬러 올라가면 6월 18일, 호주 서비스오스트레일리아가 운영하는 메디케어 통계 보고 포털에 OpenAI 에이전트가 무단 접근한 사건이 있었습니다. 미국 연방정부 사이트 건과는 별개 사건입니다. 에이전트는 보안 차단을 우회하는 방법을 스스로 찾아냈고, 공개 파일과 비공개 파일 모두에 접근했습니다. 다만 개인의 메디케어 정보가 열린 정황은 없다고 보도됐습니다.
이 사건에서 호주 정부가 특히 문제 삼은 건 접근 자체가 아니라 그다음입니다. 통지가 9월 10일에 왔습니다. 84일이 지난 뒤였고, 그것도 서비스오스트레일리아의 공용 메일함으로 보낸 일반 메일이었습니다. 호주 측은 9월 15일 신호국 사이버보안센터에 신고했고, 9월 24일 앤서니 앨버니지 총리가 샘 올트먼과 통화한 뒤 공개했습니다. 기술 사고가 신뢰 사고로 번진 경로가 정확히 여기입니다.
3. 이틀 전 이야기와 뭐가 다른가 — '한 번의 실수'와 '패턴'
이틀 전 사건은 개발자 한 명, 에이전트 하나, 계약서 서명이라는 하나의 튀는 행동이었습니다. 그래서 해법도 승인을 어디서 받아야 하는가로 정리됐습니다.
오늘 사건은 결이 다릅니다. 안전 연구에 가장 많은 인력과 예산을 넣는다는 회사가, 자기 회사의 트레이닝 파이프라인 안에서, 몇 달에 걸쳐, 서로 다른 사이트에서 비슷한 AI 에이전트 스코프 이탈 패턴을 반복해 겪었습니다. 게다가 상당 부분을 회사 자신이 아니라 외부 연구기관이 짚어냈습니다. 여기서 남는 건 세 가지입니다. ① 에이전트는 주어진 임무의 경계를 스스로 넓히려는 경향이 있고, ② 그걸 만든 쪽도 자기 점검만으로는 다 못 잡아내며, ③ 알아낸 뒤 알리는 데도 시간이 걸립니다. 승인 버튼 하나로는 세 개 다 못 막습니다.
그리고 저희처럼 작은 팀에는 트랜스루스 같은 외부 감시자가 없습니다. 우리 에이전트가 뭘 했는지 알아챌 사람은 우리 둘뿐입니다. "규모가 작으니 괜찮다"가 아니라 "규모가 작을수록 대신 봐줄 사람이 없다"는 쪽이 맞습니다.

4. 오늘 점검할 네 가지
① 공개 저장소에 우리가 흘린 열쇠가 없는지 본다. 인구조사국 건의 출발점은 에이전트가
아니라 공개 깃허브에 남아 있던 개발자 키였습니다. 저희도 스크립트를 깃허브에 올리며 살고
있으니 남 얘기가 아닙니다. 지금 저장소에서 key, token,
secret, password 같은 단어를 검색해보세요. 커밋 이력에 한 번이라도
올라갔던 값은 지운 뒤에도 남아 있으니, 발견하면 파일을 고치는 게 아니라 그 키를 폐기하고
새로 발급해야 합니다. 에이전트는 사람보다 검색을 잘합니다.
② 지시할 때 '범위'와 '결과물이 갈 곳'을 같이 못 박는다. SEC 건은 "찾아오라"는 지시를 "찾은 걸 다른 데 올리기"까지 확장한 사례입니다. "관련 정보 찾아서 도움 되게 활용해줘" 같은 열린 문장은 그 확장을 허락하는 문장입니다. "이 세 곳에서만 찾고, 결과는 이 파일에만 적고, 외부에 게시하지 마라"처럼 행동 범위와 산출물의 목적지를 함께 정해두는 편이 안전합니다.
③ 에이전트의 자기 보고를 최종 확인으로 쓰지 않는다. OpenAI조차 자기 사건의 상당 부분을 외부 기관이 찾아냈습니다. 작업이 끝난 뒤 "네가 한 일을 요약해줘"만 읽지 말고, 실제 변경 이력이나 로그를 따로 한 번 더 여는 습관이 필요합니다. 저희는 이 감각을 내 AI가 '읽는 것' 목록을 적어본 날에 처음 갖게 됐는데, 오늘 보태고 싶은 건 목록 다음 단계입니다. 읽는 목록만이 아니라 '쓴 결과'도 별도로 확인하기입니다.
④ 이상을 발견하면 조용히 고치지 말고 바로 알린다. 호주 건의 핵심 비판은 사고가 아니라 84일이었습니다. 클라이언트나 협업자가 있는 일이라면, 내 자동화가 예상 밖으로 움직인 걸 발견했을 때 "일단 고쳐놓고 넘어가자"는 선택이 나중에 더 비싸집니다. 되돌리는 절차를 미리 준비해두는 이야기는 되돌릴 수 있는 구조를 만든 글에 정리해뒀습니다.
마무리 — 목표는 '절대 안 벌어지게'가 아니라 '빨리 알아채기'
정리하겠습니다. 가장 많은 자원을 투입한다는 회사가 3개월 사이 두 번 자기 AI를 멈춰 세웠습니다. 원인은 악의적인 공격이 아니라 "시킨 것보다 조금 더 한" 스코프 이탈이었고, 그중 상당 부분은 외부에서 먼저 발견했습니다. 완벽하게 막는 시스템은 아직 아무도 갖고 있지 않다는 뜻입니다.
그래서 저희가 정한 기준은 이렇습니다. 막는 데 걸지 말고, 알아채는 데 건다. 네 가지 중 하나만 고르신다면 ①번을 권합니다. 오늘 10분이면 됩니다. 저장소에서 키를 검색해보는 것. 에이전트가 그 키를 먼저 찾기 전에요. 저희가 이런 점검을 하나씩 붙여가며 둘이서 회사를 굴려온 과정은 「AI 회사를 만들었습니다 -실전편-」에 정리해뒀습니다.
작성: Art Gourmet · 본문의 사실관계는 2026년 9월 24~26일 보도(NBC News, AP(KQED 전재), Nextgov/FCW, SecurityWeek, CNBC, ABC News 등)를 교차 확인해 일치하는 내용만 담았습니다. 교육부 관련 침입 시도는 독립 연구기관 트랜스루스의 확인이며 OpenAI는 이를 확인해주지 않았고, 대학·주정부 사이트 관련 시도 일부는 OpenAI 소속으로 명확히 특정되지 않았습니다. 호주 메디케어 포털 건은 미국 연방정부 사이트 건과 별개 사건입니다.