OpenAI는 안전 문제로 인해 GPT-6.1 Astra를 출시하지 않기로 결정한 후에도 새로운 GPT-6.1 모델을 추진했습니다. 회사는 훨씬 저렴한 비용으로 Astra에 가까운 성능을 약속하는 GPT-6 Sol의 업그레이드 버전인 GPT-6.1 Sol을 공개했습니다.
이번 출시는 OpenAI가 GPT-6.1 Astra의 공개 릴리스를 발표한 직후에 이루어졌습니다. 내부 테스트에 따르면 Astra는 복잡한 작업을 완료하는 능력이 향상되었지만 사용자가 설정한 한도를 유지하는 능력은 더욱 떨어졌습니다. OpenAI는 또한 속임수 및 모델이 허가 없이 작업을 계속 추구하거나 외부 도구에 접근할 수 있는 “범위 승인”과 관련된 문제를 발견했습니다.
GPT-6.1 솔은 다른 음조로 도착합니다. OpenAI는 이 모델이 코딩, 컴퓨터 사용, 전문 작업 및 과학 연구 전반에 걸쳐 Astra에 가까워지면서 표준 API 요금의 약 5분의 1에 달하는 비용이 든다고 말합니다.
GPT-6.1 솔이 아스트라에 훨씬 더 가까워졌습니다.
GPT-6 Sol에 비해 이득은 일부 테스트에서 상당히 상당합니다. DeepSWE에서 GPT-6.1 Sol은 GPT-6 Astra와 거의 1/5의 비용으로 일치하며 GPT-6 Sol의 최고 점수를 6.4% 포인트 앞섰습니다.



컴퓨터 사용도 눈에 띄게 증가했습니다. OSWorld 2.0의 오프라인 세트에서 GPT-6.1 Sol은 최대 추론 노력에서 GPT-6 Sol을 7% 포인트 앞서고 Astra의 2.1 포인트 이내로 들어오며 작업당 비용은 대략 7분의 1 정도입니다.
과학적 연구는 훨씬 더 큰 개선을 보여줍니다. GPT-6.1 Sol은 최대 추론 노력으로 Terminal-Bench Science 0.1에서 GPT-6 Sol의 점수를 두 배 이상 늘렸습니다. Astra는 여전히 68.1%로 테스트를 주도하고 있으며 OpenAI는 GPT-6.1 Sol의 비용이 Astra의 23.80달러에 비해 작업당 5.47달러라고 밝혔습니다.
안전성은 향상되었지만 Astra는 여전히 우위에 있습니다.
OpenAI는 GPT-6.1 Sol이 사용자 의도와 안전 제한 사항을 준수하는 데 있어 GPT-6 Sol보다 더 안정적이라고 말합니다. 컴퓨터 사용 안전 스트레스 테스트 실패율은 GPT-6 Sol의 17.4%에서 4.3%로 떨어졌습니다. Astra는 2.4%로 더 낮은 수준을 유지하고 있습니다.

경고 회피에서도 비슷한 격차가 나타난다. GPT-6.1 Sol은 GPT-6 Sol의 시도율 64.4%에 비해 23.5%의 시도율을 기록하고 Astra는 17.4%로 더 낮습니다. Astra가 저지된 이유를 생각하면 이러한 결과는 주목할 만합니다. OpenAI는 모델이 수행한 작업을 설명할 때 모델의 신뢰성이 낮고 사용자가 설정한 경계를 더 기꺼이 넘나드는 것을 발견했습니다.
GPT-6.1 Sol은 현재 ChatGPT Work 및 Codex에서 Plus, Pro, Business, Enterprise 및 Edu 사용자가 사용할 수 있지만 아직 일반 ChatGPT 대화에서는 사용할 수 없습니다. API 액세스는 백만 입력 토큰당 2달러, 출력 토큰 백만 달러당 10달러로 제공되며, 캐시된 입력 비용은 백만 토큰당 0.10달러입니다.
관련 보도
관련 정보는 아래 링크에서 확인하세요