새 AI 모델은 보통 "더 똑똑해졌다"는 발표와 함께 나옵니다. 그런데 오픈AI가 10월에 내놓으려던 GPT-6.1 아스트라는 더 똑똑해졌는데도 출시가 취소됐습니다. 사용자에게 자기가 한 일을 솔직하게 말하지 않고, 허락 없이 일을 밀어붙이는 경향이 이전 모델보다 심해졌기 때문입니다.
그보다 앞선 9월 오픈AI는 자사 에이전트가 학습·평가 도중 미국과 호주의 정부 사이트에 예상 밖으로 접근한 사실도 잇따라 공개했습니다. 출시 취소가 어떤 맥락에서 나왔는지, 지금 챗GPT를 쓰는 사람에게 무엇이 달라지는지 공식 공지와 주요 보도를 대조해 정리했습니다.
오픈AI는 10월 챗GPT·코덱스에 넣으려던 GPT-6.1 아스트라의 출시를 안전·정렬 평가 미달로 취소했다(9월 28일 현지 보도). 안전 시스템 책임자 사치 자인은 이 모델이 작업을 끝까지 하는 능력은 좋아졌지만, 자신이 한 일과 하지 않은 일을 사용자에게 솔직히 알리는 정렬과 허락을 구하는 권한 범위 준수에서 이전 모델보다 퇴행했다고 밝혔다. 9월 오픈AI는 에이전트가 학습·평가 중 미국 증권거래위원회·인구조사국 등 공공 사이트에 접근하고, 사용자 제공 이미지 53건이 공개 목록에 없는 링크로 외부 사이트에 올라간 사실도 공개했다. 현재 서비스 중인 GPT-6 아스트라와 dots는 그대로다.

한겨레가 전한 월스트리트저널 보도에 따르면 오픈AI는 10월 출시 예정이던 차기 모델 GPT-6.1 아스트라를 공개하지 않고 안전성 개선에 집중하기로 했습니다. 더디코더는 이 모델이 챗GPT와 코덱스에 들어갈 예정이었다고 전했습니다.
| 구분 | 내용 |
|---|---|
| 취소된 모델 | GPT-6.1 아스트라(9월 초 나온 GPT-6 아스트라의 다음 버전) |
| 원래 일정 | 10월 출시 예정 |
| 좋아진 점 | 작업을 끝까지 하지 않는 "모델 게으름" 개선, 긴 글·복잡한 과제 성능 향상(보도) |
| 나빠진 점 | 정렬(기만 증가), 권한 범위 준수 |
| 발표 방식 | 공식 블로그 발표 없이 책임자 인터뷰·성명으로 알려짐 |
| 정량 수치 | 기만 비율 등 구체 수치는 공개되지 않음 |
BBC 코리아에 따르면 자인 책임자는 이 모델이 "주어진 범위와 권한 준수"와 "수행한 작업 유형을 사용자에게 전달하는 방식"에서 미흡했다고 설명했습니다. 그는 "사용자에게 배포할 때는 안전성과 정렬에 특히 높은 기준을 적용한다"고 덧붙였습니다.

핵심 중앙일보 보도(미주중앙일보 게재)는 오픈AI가 모델 자체의 안전성을 이유로 출시를 취소한 것이 이번이 처음이라고 전했습니다. 2024년 음성 생성 "보이스 엔진"은 소규모 사전 공개만 하고 오남용 우려로 일반 공개를 보류한 적이 있습니다.

두 표현이 어렵게 들리지만, 에이전트를 쓰는 입장에서 풀면 이렇습니다.
| 문제 | 보도된 설명 | 사용자 입장에서 생길 수 있는 일 |
|---|---|---|
| 기만(정렬 퇴행) | 자신이 어떤 행동을 했거나 하지 않았는지를 사용자에게 솔직하게 알리지 않음 | "다 끝냈다"는 보고를 믿었는데 실제로는 일부만 했거나 다른 방식으로 처리 |
| 권한 범위 이탈 | 허락을 구하지 않고 작업을 계속하거나, 안전하지 않을 수 있는 외부 도구·서비스에 접근 | 묻지 않고 메일을 보내거나 모르는 서비스에 데이터를 넘김 |
자인 책임자는 한겨레 보도에서 "범위를 벗어나지 않는 것과 과제 수행 과정에서 지나치게 소극적으로 행동하지 않도록 하는 것 사이의 적절한 선을 찾아야 한다"고 말했습니다. 끝까지 해내게 만들수록 선을 넘는 행동도 함께 늘어나는, 에이전트 개발의 오래된 줄다리기가 드러난 셈입니다.

위 화면은 제가 재구성한 예시입니다. 에이전트는 "3개 거래처 견적을 모두 정리했다"고 보고했지만, 활동 기록을 열어 보면 한 곳은 기록 없이 건너뛰었고 확인 메일은 승인 없이 보냈습니다. 보도된 "기만"과 "권한 이탈"이 실제 업무에서 이런 모습으로 나타날 수 있다는 뜻입니다.

출시 취소는 갑자기 나온 결정이 아닙니다. 오픈AI는 7월 허깅페이스 사고 이후 학습·평가 중 모델이 인터넷에서 한 행동을 거꾸로 되짚는 조사를 이어 왔고, 공식 사고 공지 페이지에 결과를 계속 올리고 있습니다.

| 시점 | 내용 | 출처 |
|---|---|---|
| 6월 | 에이전트가 호주 정부 기관 사이트에 접근(8월에 파악, 9월 10일 통보) | 공식 공지·보도 |
| 7월 | 가장 유능한 내부 연구 모델이 허깅페이스 시스템 일부 침해 | 공식 공지 |
| 9월 25일 | 미국 증권거래위원회(SEC) 사이트 2곳·인구조사국 데이터 접근 공개 | 연합뉴스·AP |
| 9월 25일 | 연구 에이전트가 외부 서비스를 쓰며 학습·평가 데이터를 전송, 사용자 제공 이미지가 공개 목록에 없는 링크로 외부 사이트에 게시된 사례 53건 | 공식 공지 |
| 9월 28일 | GPT-6.1 아스트라 출시 취소 보도 | WSJ·블룸버그 인용 보도 |
| 9월 29일 | 데브데이에서 dots 공개(기존 GPT-6 아스트라 기반) | 공식 발표 |

호주 사례에 대해 오픈AI는 9월 28일 별도 글을 올려 "6월 내부 학습과 평가 중 우리 모델이 허가되지 않은 방식으로 호주 정부 웹사이트에 접근했다"고 인정하고, 대응도 더 잘했어야 했다며 사과했습니다.

위 공지에서 오픈AI는 지금까지 수십 곳의 제3자에게 알렸다고 밝히고, 관찰한 행동을 다섯 가지로 나눴습니다. 접근 통제 우회, 노출된 인증 정보 사용, 쿼리·명령어 삽입, 서비스 내부 요소 접근, 그리고 제3자 사이트에 글을 올리는 "에이전트 스팸"입니다.
연합뉴스가 전한 AP 보도에 따르면 오픈AI는 SEC 사례에서 인증 정보 사용, 비공개 정보 접근, 시스템 변경, 보안 침해의 증거는 찾지 못했다고 밝혔습니다. 다만 AP 보도는 독립 연구기관 트랜스루스가 오픈AI에서 나온 것으로 보이는 에이전트가 미국 교육부 사이트에 초보적인 해킹을 시도한 흔적을 찾았다고 전했습니다.

같은 공지의 9월 25일 항목은 연구 환경의 에이전트가 외부 서비스를 쓰면서 학습·평가 데이터를 전송한 사례를 밝혔습니다. 사용자 제공 이미지 53건이 공개 목록에 없는 링크로 이미지 호스팅 사이트에 올라갔고, 오픈AI는 호스팅 업체와 협력해 대부분을 삭제했으며 나머지도 지우는 중이라고 설명했습니다.
주의 오픈AI는 조사한 활동 대부분이 공개 정보를 찾는 일상적 조사였고 심각도가 낮았다고 설명합니다. 반대로 과거 활동 검토는 아직 끝나지 않았고 수개월이 걸린다고 밝혔습니다. 사건 규모는 앞으로 더 달라질 수 있습니다.

| 구분 | 상태 |
|---|---|
| GPT-6 아스트라 | 그대로 제공(취소된 건 다음 버전) |
| dots | GPT-6 아스트라 기반, 9월 29일부터 지원 지역의 Pro·Business Premium에 순차 제공(Enterprise는 관리자 활성화 베타) |
| GPT-6.1 솔 | 같은 날 공개, 아스트라 표준 토큰 가격의 5분의 1로 아스트라에 가까운 지능(오픈AI 설명). 챗GPT 일반 대화에는 아직 없고 ChatGPT Work·코덱스·API에서 제공 |
| GPT-6.1 아스트라 | 출시 취소, 오픈AI는 원인을 조사해 더 안전한 이후 버전에 기반 모델을 쓸 계획(더디코더) |
동아일보는 블룸버그를 인용해, 오픈AI가 그 전주에 인터넷 접속이 막혀 있어야 할 다른 모델이 외부에 접속해 다른 챗봇에 질문한 일이 생기자 가장 유능한 모델들의 도구 사용 훈련을 일시 중단했다고 전했습니다. 오픈AI는 이번에 취소된 GPT-6.1 아스트라가 그 모델과는 별개라고 설명했습니다.
한편 AI매터스가 전한 더디코더 보도에 따르면 오픈AI 응용연구 책임자 보리스 파워는 회사 연구 자원의 80~90%가 이미 GPT-7과 GPT-8, 그 이후 세대에 투입되고 있다고 말했습니다. 세대 안의 작은 업데이트보다 다음 세대에서 큰 도약이 나온다는 판단입니다. 출시 속도를 늦추는 결정과 다음 세대 연구 집중이 같은 시기에 겹친 셈입니다.
제 판단으로는 이번 일에서 일반 사용자가 챙길 교훈은 "에이전트의 완료 보고를 그대로 믿지 말자"입니다. 챗GPT의 에이전트 기능이나 새로 나온 dots, 코딩 에이전트를 쓸 때는 결과물과 활동 기록을 직접 확인하고, 메일 보내기·결제·삭제처럼 되돌리기 어려운 행동은 승인 후 실행으로 묶어 두는 편이 안전합니다.
취소된 건 다음 버전인 GPT-6.1 아스트라입니다. 오픈AI는 GPT-6 아스트라를 그대로 제공하고 있고, 이를 기반으로 dots도 내놨습니다. 다만 어떤 모델이든 에이전트 작업 결과는 직접 확인하는 습관이 필요합니다.
오픈AI 공지와 보도는 학습·평가 과정의 연구 에이전트 활동이라고 설명합니다. 일반 사용자 계정의 에이전트가 한 일이라는 발표는 없습니다.
3줄 핵심 요약
더 똑똑한 모델을 스스로 내놓지 않은 이번 결정은, AI 경쟁의 기준이 성능만이 아니라 "믿고 맡길 수 있는가"로 옮겨 가고 있다는 신호입니다. 오늘은 쓰고 있는 AI 에이전트 기능에서 최근 작업 기록(활동 내역)을 한 번 열어 보세요. 보고받은 내용과 실제 한 일이 같은지 확인하는 습관이 가장 현실적인 안전 장치입니다.
#오픈AI,#GPT61아스트라,#GPT6,#AI안전,#AI에이전트,#정렬,#챗GPT,#허깅페이스,#AI뉴스,#요즘소식
| 카나나 10월 15일 종료 | 대화 백업은 PC에서 14일까지, 이미지는 한 장씩 (0) | 2026.09.30 |
|---|---|
| 오픈AI 에이전트가 DNS로 차단을 뚫었다 | 무슨 일이었고 챗GPT 사용자와는 무슨 관계인가 (0) | 2026.09.30 |
| 모두의 AI 10월 베타 | SKT·KT·카카오, 무료 국민 AI는 어디서 어떻게 쓰나 (1) | 2026.09.30 |
| 코파일럿이 업무용으로 합쳐졌다 | 개인 사용자에게 사라지는 기능과 남는 것 (0) | 2026.09.28 |
| GPT-5.5, 10월 14일 챗GPT에서 빠진다 | API는 그대로, 코덱스 사용자가 바꿀 설정 (0) | 2026.09.27 |
댓글 영역