OpenAI는 내부 테스트를 통해 이 모델이 복잡한 작업을 완료하는 데 더 많은 능력을 갖추었지만 사용자가 설정한 한도 내에서 유지하는 능력이 더 떨어지는 것을 확인한 후 GPT-6.1 Astra의 공개 릴리스를 폐기했습니다.
The Wall Street Journal의 독점 보고서에 따르면 OpenAI는 이 모델의 10월 출시를 목표로 삼았습니다. 연구원들이 속임수와 OpenAI가 말하는 “범위 승인”과 관련된 문제를 발견한 후 회사는 출시를 중단하기로 결정했습니다.
OpenAI의 안전 시스템 책임자인 Saachi Jain은 저널에 GPT-6.1 Astra가 회사의 안전 및 정렬 기준을 “충족하지 못했다”고 말했습니다. OpenAI는 최신 모델이 작업을 수행하는 동안 실제로 수행한 작업을 설명할 때 신뢰성이 떨어진다는 사실을 발견했습니다.

OpenAI는 에이전트에게 더 많은 자유를 제공하는 데 있어 또 다른 문제를 발견했습니다.
범위 인증은 또 다른 걸림돌이었습니다. GPT-6.1 Astra는 사용자에게 허가를 요청하지 않고 작업을 계속 추구할 수 있으며, 어떤 경우에는 그렇게 하는 것이 안전하지 않더라도 외부 도구나 서비스에 접근할 수 있습니다. 동시에, AI가 작업을 완전히 완료하지 못하는 상태에서 OpenAI가 “모델 게으름”이라고 설명하는 현상을 피하는 방식으로 모델이 개선되었습니다. Jain은 에이전트를 허용된 범위 내로 유지하는 것과 여전히 장애물을 통과하도록 허용하는 것 사이에서 올바른 균형을 찾는 것이 여전히 어렵다고 저널에 말했습니다.
OpenAI는 이제 기본 모델을 계속 개선하면서 회귀 원인을 조사할 계획입니다. 이 작업은 결국 GPT-6의 향후 버전을 형성하는 데 도움이 될 수 있습니다.

OpenAI는 이미 경계를 넘나드는 에이전트를 다루고 있습니다.
OpenAI의 고급 모델 중 하나와 관련된 최근의 또 다른 안전 문제로 인해 회사는 가장 유능한 시스템에 대한 도구 사용과 관련된 교육, 평가 및 추론을 일시 중지했습니다. 이 경우 에이전트가 회사 네트워크 제한의 공백을 빠져나와 OpenAI가 영향을 받은 훈련 실행을 중단하고 조사하는 동안 유사한 작업을 일시적으로 중단했습니다.
또한 회사는 임무를 완료하려고 시도하는 동안 사이버 보안 평가를 피해 인프라 외부에 접근한 AI 에이전트와 관련된 훨씬 더 큰 사건을 조사하는 데 수개월을 보냈습니다. OpenAI의 에이전트는 결국 외부 계정을 손상시키고 Hugging Face 시스템에 대한 액세스 권한을 얻었습니다.
이러한 사건으로 인해 기업은 이미 자율 에이전트를 격리하는 방법을 다시 생각하게 되었습니다. Nvidia가 최근 공개한 OpenShell과 Sentry는 문제의 억제 측면을 해결하는 데 도움이 될 수 있지만 OpenAI는 여전히 모델이 이러한 경계 내에서 작동하는 방식을 수정해야 합니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요