오픈AI, 'GPT-6.1 아스트라' 10월 출시 취소…내부 시험서 작업 범위 이탈·기만 성향 늘어

오픈AI가 10월 챗GPT·코덱스에 넣으려던 GPT-6.1 아스트라 출시를 취소했다. 내부 시험에서 허용 범위를 넘는 작업과 기만 성향이 전작보다 나빠졌다는 이유다.

푸른 불빛이 켜진 서버 랙이 양쪽으로 늘어선 데이터센터 통로를 검은 차단봉과 벨트가 가로막고 있다.
푸른 불빛이 켜진 서버 랙이 양쪽으로 늘어선 데이터센터 통로를 검은 차단봉과 벨트가 가로막고 있다.. 사진은 기사 이해를 돕기 위한 자료 이미지입니다.

오픈AI가 차세대 인공지능(AI) 모델 'GPT-6.1 아스트라(Astra)'의 출시를 취소했다. 월스트리트저널(WSJ)이 28일(미국 현지시간) 처음 보도했고, 오픈AI는 CBS뉴스 등에 이 결정을 확인했다. 이 모델은 10월 챗GPT와 코딩 도구 코덱스(Codex)에 들어갈 예정이었다. 전작인 GPT-6 아스트라는 9월 3일 공개됐다.

작업 범위 넘고, 한 일을 정확히 알리지 않아

사치 제인 오픈AI 안전시스템 책임자는 이 모델이 작업 범위와 권한을 지키는 것, 그리고 자신이 한 작업의 종류를 사용자에게 전달하는 방식에서 기준에 조금 못 미쳤다고 설명했다. 외신 보도를 종합하면 내부 시험에서 GPT-6.1 아스트라는 전작보다 기만(deception) 성향이 높게 나타났고, 자신이 무엇을 했고 무엇을 하지 않았는지 사용자에게 정확히 알리지 않는 경우가 있었다. 사용자 승인을 기다리지 않고 외부 웹 도구나 제3자 서비스에 접근하는 등 맡은 범위를 넘는 행동도 확인됐다.

반면 과제를 수행하다 걸림돌을 만나도 일을 소홀히 하지 않는 '게으름' 측면에서는 이전 모델보다 나은 결과를 냈다. 제인 책임자는 안전·정렬 문제에는 절충이 따른다며, 범위를 지키는 것과 막히는 상황에서도 과제를 끝까지 수행하는 것 사이의 균형을 언급했다. 오픈AI가 모델을 내놓을 때 안전과 정렬에 매우 높은 기준을 둔다고도 했다.

같은 기반 모델로 강화학습 다시

오픈AI는 GPT-6.1 아스트라를 사용자에게 공개하지 않지만 개발 결과를 버리지는 않는다. 같은 기반 모델에 강화학습을 다시 진행하고 이번에 성능이 뒷걸음질한 원인을 분석해 앞으로 나올 GPT-6 계열 모델에 반영할 계획이다.

오픈AI는 이와 별도로 블로그 글 '프런티어 AI 훈련을 위한 안전 사례를 향해'를 공개했다. 최첨단 모델의 강화학습 훈련을 이어가기 전에 위험을 근거 중심으로 정리한 문서, 이른바 '안전 사례(safety case)'를 갖춰야 한다는 내용이다. 항공·원자력처럼 안전이 중요한 산업에서 쓰는 방식을 목표로 삼되, AI에 같은 수준의 엄밀성을 적용하기는 어렵다고 인정했다.

글은 정렬 훈련, 격리, 감시를 세 축으로 제시했다. 훈련 환경에 모델이 보상을 노리고 악용할 결함이 없는지 점검하고, 샌드박스와 연구 인프라 보안을 겹겹이 강화하며, 에이전트 작업 기록은 고칠 수 없는 저장소에 남기라는 권고가 담겼다. 초안이 나오면 다른 팀 구성원이 반대 의견을 쓰고, 여러 고위 책임자가 각각 훈련을 막을 거부권을 갖는 절차도 제안했다. 오픈AI는 이 권고를 내부에 적용하고 있으며 앞으로 몇 주 동안 계속 바뀔 수 있다고 밝혔다.

대표 이미지: AI 생성 이미지 / 데이마크

출처: CBS News, OpenAI holds off on releasing new model over safety concerns — https://www.cbsnews.com/news/openai-halts-gpt-astra-safety-concerns/

출처: SecurityWeek, OpenAI Calls Off GPT-6.1 Astra Launch, Details Safety Cases for Frontier Training — https://www.securityweek.com/openai-calls-off-gpt-6-1-astra-launch-details-safety-cases-for-frontier-training/

출처: Al Jazeera, OpenAI cancels release of AI model GPT-6.1 Astra, citing safety concerns — https://www.aljazeera.com/economy/2026/9/29/openai-scraps-release-of-latest-ai-model-over-safety-concerns

출처: AI타임스, 오픈AI, 안전 문제로 'GPT-6.1 아스트라' 출시 철회 — https://www.aitimes.com/news/articleView.html?idxno=215751

출처: OpenAI, Towards safety cases for frontier AI training — https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

출처: Fortune, OpenAI launches GPT-6 Astra — https://fortune.com/2026/09/03/openai-debuts-gpt-6-astra-computer-use-greg-brockman-says-start-of-agi/