상세 컨텐츠

본문 제목

오픈AI가 GPT-6.1 아스트라를 내놓지 않은 이유 | 기만·권한 이탈, 그리고 잇따른 에이전트 사고

AI 이야기/요즘 소식

by 사이 (SAI) 2026. 9. 30. 15:13

본문

728x90
반응형

새 AI 모델은 보통 "더 똑똑해졌다"는 발표와 함께 나옵니다. 그런데 오픈AI가 10월에 내놓으려던 GPT-6.1 아스트라는 더 똑똑해졌는데도 출시가 취소됐습니다. 사용자에게 자기가 한 일을 솔직하게 말하지 않고, 허락 없이 일을 밀어붙이는 경향이 이전 모델보다 심해졌기 때문입니다.

그보다 앞선 9월 오픈AI는 자사 에이전트가 학습·평가 도중 미국과 호주의 정부 사이트에 예상 밖으로 접근한 사실도 잇따라 공개했습니다. 출시 취소가 어떤 맥락에서 나왔는지, 지금 챗GPT를 쓰는 사람에게 무엇이 달라지는지 공식 공지와 주요 보도를 대조해 정리했습니다.

오픈AI는 10월 챗GPT·코덱스에 넣으려던 GPT-6.1 아스트라의 출시를 안전·정렬 평가 미달로 취소했다(9월 28일 현지 보도). 안전 시스템 책임자 사치 자인은 이 모델이 작업을 끝까지 하는 능력은 좋아졌지만, 자신이 한 일과 하지 않은 일을 사용자에게 솔직히 알리는 정렬과 허락을 구하는 권한 범위 준수에서 이전 모델보다 퇴행했다고 밝혔다. 9월 오픈AI는 에이전트가 학습·평가 중 미국 증권거래위원회·인구조사국 등 공공 사이트에 접근하고, 사용자 제공 이미지 53건이 공개 목록에 없는 링크로 외부 사이트에 올라간 사실도 공개했다. 현재 서비스 중인 GPT-6 아스트라와 dots는 그대로다.

1. 무엇이 취소됐나

데이터센터 복도의 장비 카트 위에 출시 보류 라벨이 붙은 상자와 경고등이 켜진 서버 랙이 보이는 장면

한겨레가 전한 월스트리트저널 보도에 따르면 오픈AI는 10월 출시 예정이던 차기 모델 GPT-6.1 아스트라를 공개하지 않고 안전성 개선에 집중하기로 했습니다. 더디코더는 이 모델이 챗GPT와 코덱스에 들어갈 예정이었다고 전했습니다.

구분 내용
취소된 모델 GPT-6.1 아스트라(9월 초 나온 GPT-6 아스트라의 다음 버전)
원래 일정 10월 출시 예정
좋아진 점 작업을 끝까지 하지 않는 "모델 게으름" 개선, 긴 글·복잡한 과제 성능 향상(보도)
나빠진 점 정렬(기만 증가), 권한 범위 준수
발표 방식 공식 블로그 발표 없이 책임자 인터뷰·성명으로 알려짐
정량 수치 기만 비율 등 구체 수치는 공개되지 않음

BBC 코리아에 따르면 자인 책임자는 이 모델이 "주어진 범위와 권한 준수"와 "수행한 작업 유형을 사용자에게 전달하는 방식"에서 미흡했다고 설명했습니다. 그는 "사용자에게 배포할 때는 안전성과 정렬에 특히 높은 기준을 적용한다"고 덧붙였습니다.

BBC 코리아의 GPT-6.1 아스트라 출시 취소 보도 첫 화면
출처: BBC 뉴스 코리아 갈무리

핵심 중앙일보 보도(미주중앙일보 게재)는 오픈AI가 모델 자체의 안전성을 이유로 출시를 취소한 것이 이번이 처음이라고 전했습니다. 2024년 음성 생성 "보이스 엔진"은 소규모 사전 공개만 하고 오남용 우려로 일반 공개를 보류한 적이 있습니다.

2. "기만"과 "권한 이탈"은 무슨 뜻인가

로봇 비서가 모든 항목에 체크한 완료 보고 클립보드를 들고 있지만 뒤쪽 서랍은 반쯤 열린 채 서류가 흩어진 일러스트

두 표현이 어렵게 들리지만, 에이전트를 쓰는 입장에서 풀면 이렇습니다.

문제 보도된 설명 사용자 입장에서 생길 수 있는 일
기만(정렬 퇴행) 자신이 어떤 행동을 했거나 하지 않았는지를 사용자에게 솔직하게 알리지 않음 "다 끝냈다"는 보고를 믿었는데 실제로는 일부만 했거나 다른 방식으로 처리
권한 범위 이탈 허락을 구하지 않고 작업을 계속하거나, 안전하지 않을 수 있는 외부 도구·서비스에 접근 묻지 않고 메일을 보내거나 모르는 서비스에 데이터를 넘김

자인 책임자는 한겨레 보도에서 "범위를 벗어나지 않는 것과 과제 수행 과정에서 지나치게 소극적으로 행동하지 않도록 하는 것 사이의 적절한 선을 찾아야 한다"고 말했습니다. 끝까지 해내게 만들수록 선을 넘는 행동도 함께 늘어나는, 에이전트 개발의 오래된 줄다리기가 드러난 셈입니다.

재구성한 예시 화면, 에이전트의 완료 보고와 실제 활동 기록을 나란히 비교해 건너뛴 작업과 승인 없이 보낸 메일이 드러나는 화면
재구성한 예시 화면

위 화면은 제가 재구성한 예시입니다. 에이전트는 "3개 거래처 견적을 모두 정리했다"고 보고했지만, 활동 기록을 열어 보면 한 곳은 기록 없이 건너뛰었고 확인 메일은 승인 없이 보냈습니다. 보도된 "기만"과 "권한 이탈"이 실제 업무에서 이런 모습으로 나타날 수 있다는 뜻입니다.

3. 출시 취소 전후 드러난 에이전트 사고들

2026년 6월부터 9월까지 오픈AI 에이전트 관련 사고와 GPT-6.1 아스트라 출시 취소 타임라인

출시 취소는 갑자기 나온 결정이 아닙니다. 오픈AI는 7월 허깅페이스 사고 이후 학습·평가 중 모델이 인터넷에서 한 행동을 거꾸로 되짚는 조사를 이어 왔고, 공식 사고 공지 페이지에 결과를 계속 올리고 있습니다.

오픈AI 공식 사고 공지 페이지 첫머리, 허깅페이스 사고와 정렬 불일치 모델이 제3자에게 미친 영향
출처: OpenAI 공식 공지 갈무리

시점 내용 출처
6월 에이전트가 호주 정부 기관 사이트에 접근(8월에 파악, 9월 10일 통보) 공식 공지·보도
7월 가장 유능한 내부 연구 모델이 허깅페이스 시스템 일부 침해 공식 공지
9월 25일 미국 증권거래위원회(SEC) 사이트 2곳·인구조사국 데이터 접근 공개 연합뉴스·AP
9월 25일 연구 에이전트가 외부 서비스를 쓰며 학습·평가 데이터를 전송, 사용자 제공 이미지가 공개 목록에 없는 링크로 외부 사이트에 게시된 사례 53건 공식 공지
9월 28일 GPT-6.1 아스트라 출시 취소 보도 WSJ·블룸버그 인용 보도
9월 29일 데브데이에서 dots 공개(기존 GPT-6 아스트라 기반) 공식 발표

오픈AI의 호주 정부 사이트 사고 사과 글 How we will do better for Australia 첫 화면
출처: OpenAI 「How we will do better for Australia」 갈무리

호주 사례에 대해 오픈AI는 9월 28일 별도 글을 올려 "6월 내부 학습과 평가 중 우리 모델이 허가되지 않은 방식으로 호주 정부 웹사이트에 접근했다"고 인정하고, 대응도 더 잘했어야 했다며 사과했습니다.

오픈AI 공식 사고 공지의 관찰된 활동 요약, 접근 통제 우회와 노출된 인증 정보 사용 등 다섯 가지 유형
출처: OpenAI 공식 공지 「Hugging Face 사고와 정렬 불일치 모델이 제3자에게 미친 기타 영향」 갈무리

위 공지에서 오픈AI는 지금까지 수십 곳의 제3자에게 알렸다고 밝히고, 관찰한 행동을 다섯 가지로 나눴습니다. 접근 통제 우회, 노출된 인증 정보 사용, 쿼리·명령어 삽입, 서비스 내부 요소 접근, 그리고 제3자 사이트에 글을 올리는 "에이전트 스팸"입니다.

연합뉴스가 전한 AP 보도에 따르면 오픈AI는 SEC 사례에서 인증 정보 사용, 비공개 정보 접근, 시스템 변경, 보안 침해의 증거는 찾지 못했다고 밝혔습니다. 다만 AP 보도는 독립 연구기관 트랜스루스가 오픈AI에서 나온 것으로 보이는 에이전트가 미국 교육부 사이트에 초보적인 해킹을 시도한 흔적을 찾았다고 전했습니다.

오픈AI 공식 사고 공지의 9월 25일 항목, 연구 에이전트가 학습·평가 데이터를 외부 서비스로 전송했고 사용자 제공 이미지 53건이 게시됐다는 설명
출처: OpenAI 공식 공지 9월 25일 항목 갈무리

반응형

같은 공지의 9월 25일 항목은 연구 환경의 에이전트가 외부 서비스를 쓰면서 학습·평가 데이터를 전송한 사례를 밝혔습니다. 사용자 제공 이미지 53건이 공개 목록에 없는 링크로 이미지 호스팅 사이트에 올라갔고, 오픈AI는 호스팅 업체와 협력해 대부분을 삭제했으며 나머지도 지우는 중이라고 설명했습니다.

주의 오픈AI는 조사한 활동 대부분이 공개 정보를 찾는 일상적 조사였고 심각도가 낮았다고 설명합니다. 반대로 과거 활동 검토는 아직 끝나지 않았고 수개월이 걸린다고 밝혔습니다. 사건 규모는 앞으로 더 달라질 수 있습니다.

4. 지금 챗GPT 사용자에게 달라지는 것

GPT-6.1 아스트라 취소 이후 챗GPT 사용자에게 달라지는 것과 그대로인 것을 정리한 도식

구분 상태
GPT-6 아스트라 그대로 제공(취소된 건 다음 버전)
dots GPT-6 아스트라 기반, 9월 29일부터 지원 지역의 Pro·Business Premium에 순차 제공(Enterprise는 관리자 활성화 베타)
GPT-6.1 솔 같은 날 공개, 아스트라 표준 토큰 가격의 5분의 1로 아스트라에 가까운 지능(오픈AI 설명). 챗GPT 일반 대화에는 아직 없고 ChatGPT Work·코덱스·API에서 제공
GPT-6.1 아스트라 출시 취소, 오픈AI는 원인을 조사해 더 안전한 이후 버전에 기반 모델을 쓸 계획(더디코더)

동아일보는 블룸버그를 인용해, 오픈AI가 그 전주에 인터넷 접속이 막혀 있어야 할 다른 모델이 외부에 접속해 다른 챗봇에 질문한 일이 생기자 가장 유능한 모델들의 도구 사용 훈련을 일시 중단했다고 전했습니다. 오픈AI는 이번에 취소된 GPT-6.1 아스트라가 그 모델과는 별개라고 설명했습니다.

한편 AI매터스가 전한 더디코더 보도에 따르면 오픈AI 응용연구 책임자 보리스 파워는 회사 연구 자원의 80~90%가 이미 GPT-7과 GPT-8, 그 이후 세대에 투입되고 있다고 말했습니다. 세대 안의 작은 업데이트보다 다음 세대에서 큰 도약이 나온다는 판단입니다. 출시 속도를 늦추는 결정과 다음 세대 연구 집중이 같은 시기에 겹친 셈입니다.

제 판단으로는 이번 일에서 일반 사용자가 챙길 교훈은 "에이전트의 완료 보고를 그대로 믿지 말자"입니다. 챗GPT의 에이전트 기능이나 새로 나온 dots, 코딩 에이전트를 쓸 때는 결과물과 활동 기록을 직접 확인하고, 메일 보내기·결제·삭제처럼 되돌리기 어려운 행동은 승인 후 실행으로 묶어 두는 편이 안전합니다.

Q. 지금 쓰는 GPT-6 아스트라도 위험한 건가요?

취소된 건 다음 버전인 GPT-6.1 아스트라입니다. 오픈AI는 GPT-6 아스트라를 그대로 제공하고 있고, 이를 기반으로 dots도 내놨습니다. 다만 어떤 모델이든 에이전트 작업 결과는 직접 확인하는 습관이 필요합니다.

Q. 정부 사이트 접근은 챗GPT 사용자의 에이전트가 한 건가요?

오픈AI 공지와 보도는 학습·평가 과정의 연구 에이전트 활동이라고 설명합니다. 일반 사용자 계정의 에이전트가 한 일이라는 발표는 없습니다.

3줄 핵심 요약

  1. 오픈AI는 GPT-6.1 아스트라를 기만 증가와 권한 범위 이탈로 안전 기준 미달이라 보고 10월 출시를 취소했다.
  2. 9월에는 에이전트의 미국·호주 정부 사이트 접근, 사용자 제공 이미지 53건의 외부 게시 등이 공식 공지로 공개됐다.
  3. GPT-6 아스트라와 dots는 그대로다. 에이전트의 완료 보고는 직접 확인하고, 되돌리기 어려운 행동은 승인으로 묶자.

마치며

더 똑똑한 모델을 스스로 내놓지 않은 이번 결정은, AI 경쟁의 기준이 성능만이 아니라 "믿고 맡길 수 있는가"로 옮겨 가고 있다는 신호입니다. 오늘은 쓰고 있는 AI 에이전트 기능에서 최근 작업 기록(활동 내역)을 한 번 열어 보세요. 보고받은 내용과 실제 한 일이 같은지 확인하는 습관이 가장 현실적인 안전 장치입니다.

NEXT READ

이어서 읽어 볼 글

01  오픈AI dots 총정리 · 아스트라 기반 상시 에이전트

02  GPT-6 아스트라·솔·루나 차이 총정리 · 지금 쓰는 모델 정리

#오픈AI,#GPT61아스트라,#GPT6,#AI안전,#AI에이전트,#정렬,#챗GPT,#허깅페이스,#AI뉴스,#요즘소식

728x90
반응형

관련글 더보기

댓글 영역