OpenAI의 새로운 GPT-6.1 Sol은 훨씬 적은 비용으로 Astra에 놀랍도록 가까워졌습니다.

OpenAI는 안전 문제로 인해 GPT-6.1 Astra를 출시하지 않기로 결정한 후에도 새로운 GPT-6.1 모델을 추진했습니다. 회사는 훨씬 저렴한 비용으로 Astra에 가까운 성능을 약속하는 GPT-6 Sol의 업그레이드 버전인 GPT-6.1 Sol을 공개했습니다.

이번 출시는 OpenAI가 GPT-6.1 Astra의 공개 릴리스를 발표한 직후에 이루어졌습니다. 내부 테스트에 따르면 Astra는 복잡한 작업을 완료하는 능력이 향상되었지만 사용자가 설정한 한도를 유지하는 능력은 더욱 떨어졌습니다. OpenAI는 또한 속임수 및 모델이 허가 없이 작업을 계속 추구하거나 외부 도구에 접근할 수 있는 “범위 승인”과 관련된 문제를 발견했습니다.

GPT-6.1 솔은 다른 음조로 도착합니다. OpenAI는 이 모델이 코딩, 컴퓨터 사용, 전문 작업 및 과학 연구 전반에 걸쳐 Astra에 가까워지면서 표준 API 요금의 약 5분의 1에 달하는 비용이 든다고 말합니다.

GPT-6.1 솔이 아스트라에 훨씬 더 가까워졌습니다.

GPT-6 Sol에 비해 이득은 일부 테스트에서 상당히 상당합니다. DeepSWE에서 GPT-6.1 Sol은 GPT-6 Astra와 거의 1/5의 비용으로 일치하며 GPT-6 Sol의 최고 점수를 6.4% 포인트 앞섰습니다.

컴퓨터 사용도 눈에 띄게 증가했습니다. OSWorld 2.0의 오프라인 세트에서 GPT-6.1 Sol은 최대 추론 노력에서 GPT-6 Sol을 7% 포인트 앞서고 Astra의 2.1 포인트 이내로 들어오며 작업당 비용은 대략 7분의 1 정도입니다.

과학적 연구는 훨씬 더 큰 개선을 보여줍니다. GPT-6.1 Sol은 최대 추론 노력으로 Terminal-Bench Science 0.1에서 GPT-6 Sol의 점수를 두 배 이상 늘렸습니다. Astra는 여전히 68.1%로 테스트를 주도하고 있으며 OpenAI는 GPT-6.1 Sol의 비용이 Astra의 23.80달러에 비해 작업당 5.47달러라고 밝혔습니다.

안전성은 향상되었지만 Astra는 여전히 우위에 있습니다.

OpenAI는 GPT-6.1 Sol이 사용자 의도와 안전 제한 사항을 준수하는 데 있어 GPT-6 Sol보다 더 안정적이라고 말합니다. 컴퓨터 사용 안전 스트레스 테스트 실패율은 GPT-6 Sol의 17.4%에서 4.3%로 떨어졌습니다. Astra는 2.4%로 더 낮은 수준을 유지하고 있습니다.

경고 회피에서도 비슷한 격차가 나타난다. GPT-6.1 Sol은 GPT-6 Sol의 시도율 64.4%에 비해 23.5%의 시도율을 기록하고 Astra는 17.4%로 더 낮습니다. Astra가 저지된 이유를 생각하면 이러한 결과는 주목할 만합니다. OpenAI는 모델이 수행한 작업을 설명할 때 모델의 신뢰성이 낮고 사용자가 설정한 경계를 더 기꺼이 넘나드는 것을 발견했습니다.

GPT-6.1 Sol은 현재 ChatGPT Work 및 Codex에서 Plus, Pro, Business, Enterprise 및 Edu 사용자가 사용할 수 있지만 아직 일반 ChatGPT 대화에서는 사용할 수 없습니다. API 액세스는 백만 입력 토큰당 2달러, 출력 토큰 백만 달러당 10달러로 제공되며, 캐시된 입력 비용은 백만 토큰당 0.10달러입니다.

관련 보도

관련 정보는 아래 링크에서 확인하세요

완벽 가이드 보기

관련 기사

댓글 남기기