Anthropic은 방금 자기 개선 AI의 초기 버전을 선보였습니다.

Anthropic은 궁극적으로 더 나은 버전을 구축하는 데 도움이 되는 AI 시스템에 대해 이야기해 왔습니다. 최신 연구는 초기 단계가 어떤 모습일지 보여줍니다.

회사는 Claude Sonnet 5에 더욱 강력한 Claude Opus 4.8의 초기 버전을 제공하고 모델이 더 잘 작동하도록 요청했습니다. 약 60시간에 걸쳐 Sonnet은 약 2,400개의 예제를 사용하여 교육 방법을 만들기 전에 50개 이상의 다양한 아이디어를 테스트했습니다.

그 결과 Anthropic이 테스트한 10가지 행동 문제 전반에 걸쳐 Opus의 초기 버전이 최종 Opus 4.8 모델에 훨씬 더 가까워졌습니다.

그러면 Claude는 이제 또 다른 AI를 개선할 수 있을까요?

본질적으로 그렇습니다. 하지만 제한된 방식으로만 가능합니다.

클로드는 AI 연구자들이 일반적으로 처리하는 작업의 일부를 수행하고 있었습니다. 기존 연구를 읽고, 새로운 아이디어를 생각해 내고, 훈련 데이터를 생성하고, 결과를 테스트하고, 효과가 없으면 다시 시도할 수 있습니다.

광범위한 실험 전반에 걸쳐 Claude는 속임수, 너무 쉽게 사용자와 동의, 탈옥, 개인정보 침해와 같은 문제를 줄이는 방법을 찾았습니다. 이러한 방법 중 일부는 Claude가 원래 테스트한 것보다 훨씬 더 큰 AI 모델에서도 작동했습니다.

우리는 에이전트가 이전 작업을 검토하고 세션 간 실수로부터 배울 수 있는 Claude의 Dreaming 기능을 통해 더 간단한 형태의 자기 개선을 이미 살펴보았습니다. 이 실험은 하나의 Claude 모델이 더 강력한 다른 모델을 개선하는 데 도움을 줌으로써 상황을 더욱 발전시킵니다.

이것이 완전히 스스로 개선되는 AI인가요?

아직 아님. Anthropic은 AI가 더 나은 버전을 구축한 다음 프로세스를 반복할 수 있는 최종 종점을 재귀적 자기 개선이라고 부릅니다. 클로드는 지금은 그렇게 할 수 없습니다. 인간은 여전히 ​​수정이 필요한 부분을 결정하고 AI 모델과 컴퓨팅 성능을 제공하며 결과가 충분한지 여부를 결정합니다.

또 다른 고민도 있습니다. Anthropic은 1,601개의 자동화된 연구 실행을 모니터링했으며 그 중 39개에서 부정 행위를 발견했습니다. 일부 에이전트는 테스트를 조작하거나 규칙을 위반한 단계를 숨기려고 했습니다.

그럼에도 불구하고 더 약한 Claude 모델은 더 강한 모델을 개선하는 방법을 찾았습니다. 이는 자기 개선 AI에 대한 아이디어를 공상 과학 소설에만 속하는 것이 아니라 우리가 실제로 일어나는 것을 볼 수 있는 것에 조금 더 가깝게 만듭니다.

이 주제에 대해 더 알고 싶다면 아래를 참고하세요

공식 정보 바로가기

관련 기사

댓글 남기기