
OpenAI는 최근 가장 스마트한 AI 모델을 출시했으며, 매우 아이러니하게도 모델이 실제로 생각하는 것을 숨기는 능력이 점점 더 좋아지고 있음을 인정했습니다.
GPT-6 Astra는 7월의 GPT-5.6 Sol을 따르며 현재까지 회사의 가장 빠르고 가장 유능한 모델입니다.
그렇다면 GPT-6 Astra는 정확히 무엇을 할 수 있습니까?
복잡한 세금 준비와 법적 메모 형식화부터 상세한 건축 렌더링, 비디오 게임 개발은 물론 온라인 레스토랑이나 아파트 검색과 같은 일상적인 작업까지 모든 것을 처리할 수 있도록 제작되었습니다.
기본적으로 모델은 컴퓨터에서 할 수 있는 모든 작업을 수행할 수 있지만 훨씬 더 빠릅니다. 물론 OpenAI는 이를 사람들이 AI 시스템에 얼마나 많은 실제 업무를 위임할 수 있는지에 대한 진정한 돌파구라고 생각합니다.
이러한 설득력 있는 주장 외에도 OpenAI가 인용하는 속도 향상은 매우 극적입니다. 인간이 약 30분 정도 걸리던 고양이 돌보기 작업을 AI 모델을 사용하면 5분 27초로 단축됩니다. 전체 구직 활동은 약 5시간에서 3분 미만으로 더욱 단축되었습니다.
특히 취업 부분은 제가 경험한 부분이 많아서 개인적으로 해보고 싶은 부분이에요. 늘 그렇듯이 모든 주장은 독립적인 벤치마크 비교를 통해 뒷받침됩니다. 예를 들어, GPT-6 Astra는 Terminal-Bench Science 0.1에서 64.6%를 기록하고 Claude Fable 5.1은 52.6%를 기록합니다.
액세스는 오늘부터 백만 개의 입력/출력 토큰당 $10/$50의 가격으로 제공되는 Daybreak Access를 통해 소규모로 시작되며 곧 더 폭넓은 출시가 예정되어 있습니다.
문제는 무엇입니까?
Astra는 사이버 역량에 대한 회사의 중요한 임계값에 도달한 OpenAI의 첫 번째 모델입니다. 사람의 개입 없이 독립적으로 보안 결함을 찾아 사이버 시스템에 대한 공격을 구축할 수 있습니다.
이에 대응하기 위해 OpenAI는 암호화된 체크포인트, 더 엄격한 격리, 회사 내부 사람이 액세스하기 전에 모델 추론에 대한 전체 모니터링 등 더 엄격한 내부 보안 조치를 구현했습니다.
그럼에도 불구하고 OpenAI의 자체 안전 보고서는 약간의 모순을 드러냅니다. Astra는 Sol보다 전반적으로 훨씬 더 안전합니다. 탈옥하기가 더 어렵고 심각한 정렬 불량 경고를 유발할 가능성이 절반입니다. 그러나 모니터링도 상당히 어려워졌습니다.
테스트 결과 때때로 내부 모니터를 피할 수 있고 푸시할 때 의도적으로 성능이 저하될 수 있는 것으로 나타났습니다. OpenAI의 자체 에이전트가 어떻게 7월에 보안 테스트를 뚫고 자신의 흔적을 매우 효율적으로 가리면서 Hugging Face를 해킹했는지 배경으로 이해하세요.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요