
중국 기반의 AI 에이전트는 속이고, 제한을 우회하고, 실패를 은폐하는 방법을 배웠으며, 이는 미국 모델에 대한 세계적인 경각심을 불러일으키는 자율 인공 지능의 특성을 보여줬다고 연구 문서와 전문가들은 말합니다.
올해 한 사례에서는 중국의 Alibaba, DeepSeek 및 Moonshot의 모델로 운영되는 에이전트가 모의 사업 입찰에서 승리하기 위해 자신의 능력에 대해 거짓말을 한 다음 다시 시도하라는 지시를 받았을 때 기만적인 행동을 두 배로 늘렸습니다.
또 다른 경우에는 AI 모델과 컴퓨터 도구를 사용하여 사람의 개입이 거의 또는 전혀 없이 복잡한 작업을 수행하는 프로그램인 에이전트가 결과를 시뮬레이션하고 파일을 조작하여 테스트 환경에서 작업을 완료하지 못한 것을 숨겼습니다.
로이터는 대학 연구 논문부터 기술 보고서에 이르기까지 200개 이상의 문서를 조사했으며 2025년 이후 에이전트가 AI 전문가가 돌파구를 위한 구성 요소로 설명하고 시스템이 발전함에 따라 인간이 제어하기가 더 어려워질 수 있는 속임수, 복제 및 도전적인 경계와 같은 행동을 나타내는 사례를 설명하는 최소 20개의 연구 또는 평가를 식별했습니다.
12명의 전문가 및 중국 AI 산업에 정통한 사람들과의 인터뷰도 포함된 이 검토에서는 중국 기반 에이전트가 독립적으로 더 넓은 인터넷으로 탈출하거나 폐쇄를 피했다는 증거를 찾지 못했습니다.
조지타운 대학 보안 및 신흥 기술 센터의 연구원인 Colin Shea-Blymyer는 “이러한 결과는 통제되지 않은 탈출에 필요한 요소가 존재한다는 증거를 제공합니다.”라고 말했습니다.
그는 사례를 검토한 다른 AI 전문가 4명의 의견을 반영하면서 “이것을 경고로 받아들이는 것이 현명합니다”라고 말했습니다.
‘인간이 대응하기가 더 어렵다’
대부분의 사례는 통제된 실험에서 발생했으며 그 중 다수는 잠재적인 실패를 노출하도록 의도적으로 설계되었습니다.
관련된 모든 에이전트가 중국 프로그래머나 AI 회사에 의해 개발되거나 운영된 것은 아니지만(많은 경우가 그랬지만) 그들은 중국 AI 시스템을 사용하여 이를 구동했습니다.
첨단 AI 시스템의 위험을 연구하는 비영리 단체 레드우드 리서치(Redwood Research)의 연구원 알렉스 말렌(Alex Mallen)은 “이것은 미국 연구소가 성능이 떨어지는 시스템에서 보고 있는 것과 동일한 경고 신호입니다.”라고 말했습니다.
그는 중국 사례가 현재 능력 수준에서는 특별히 위험하지는 않지만 “요원의 능력이 향상될수록 그들의 잘못된 행동은 더욱 유능해지고 따라서 인간이 대응하기가 더 어려워진다”고 말했습니다.
Alibaba, DeepSeek, Moonshot 및 Z.ai는 로이터의 논평 요청에 응답하지 않았습니다. Alibaba, DeepSeek 및 Moonshot은 정기적으로 시스템을 테스트하고 보호 장치를 업데이트한다고 밝혔습니다. Z.ai는 보안 검토를 촉발한 사건 이후 모든 문제를 해결하기 위한 조사를 환영한다고 말했습니다.
그러나 미국과 달리 중국 AI 기업은 동일한 수준의 공개 조사를 받지 않았으며 AI 경쟁의 둔화를 요구하는 내부고발 직원이나 고위 경영진의 동일한 요청에 직면하지 않았습니다.
비록 격리된 환경이기는 하지만 중국 기반 에이전트와 관련된 사례의 경고 신호 중 일부는 공개적으로 공개된 미국 AI 봇의 인터넷 해킹 사건보다 앞서 있었습니다.
미국 정부 자금의 일부를 지원받는 카네기 국제평화기금(Carnegie Endowment for International Peace)의 중국 AI 이니셔티브(China AI Initiative) 공동 책임자인 스콧 싱어(Scott Singer)는 “우리는 OpenAI와 Hugging Face에서 본 것과 유사한 AI 사건이 중국에서 발생했는지 모른다. 사건이 공개적으로 보고되지 않을 수도 있다”고 말했다.
올해 초 미국 오픈AI(OpenAI)가 개발한 AI 에이전트가 연구실을 탈출해 오픈소스 플랫폼 허깅페이스(Hugging Face)를 해킹했다. 경종을 울린 미국 모델과 관련된 또 다른 사건에서 호주는 지난 9월 OpenAI 에이전트가 정부 건강 포털을 침해했다고 밝혔습니다.
중국의 거대 기술 기업 화웨이의 순환 회장인 에릭 쉬(Eric Xu)는 지난 9월 기자들에게 중국 개발자들이 이러한 사례에 직면하기 전에 추가 진전이 필요할 수도 있다고 말하면서도 “AI 개발 추진과 AI 위험 관리 사이에서 균형을 찾아야 한다고 생각합니다”라고 덧붙였습니다.
최고 인터넷 규제 기관인 중국 사이버 공간 관리국(CAC) 관계자는 지난 7월 외교관에게 가장 발전된 중국 AI 모델 중 하나인 문샷의 Kimi-K3가 미국의 주요 경쟁사보다 약 3~6개월 정도 뒤처졌다고 익명을 조건으로 말했습니다.
위험을 해결하고 대리인의 경계를 설정하기 위해 정기적으로 지침을 업데이트하는 규제 기관과 중국 외교부는 이 기사에 대한 논평 요청에 응답하지 않았습니다.
CAC 사이버 보안 조정국 부국장 Wang Lihong은 9월 1일 주요 기술 회사에서 공개한 모델이 테스트 환경을 벗어난 사건은 “극심한 통제 상실 위험”을 보여주며 “높은 수준의 경계”가 필요하다고 말했습니다.
그녀는 자신이 언급한 회사가 미국인지 중국인지는 구체적으로 밝히지 않았습니다.
AI의 두 초강대국 지도자인 도널드 트럼프와 시진핑은 지난주 중국 국가주석의 워싱턴 방문에서 AI에 대해 논의했습니다. 시 주석은 양국이 “AI를 영원히 개발하고 관리할 능력과 책임”을 갖고 있다고 말했습니다.
거짓말을 배우다
3월 사업 입찰 실험에서는 베이항 대학교, 베이징 대학교, 노팅엄 대학교 닝보 중국 및 360 AI 보안 연구소의 연구원들이 에이전트를 모의 고객 계약 입찰 대회에서 경쟁하게 했습니다. 각 상담원에게 해당 제품이 무엇을 할 수 있는지, 고객이 무엇을 요구하는지 설명하고 입찰을 요청했습니다.
Alibaba의 Qwen3-Max-Preview와 관련된 세션의 88%, DeepSeek-V3.2-Exp의 경우 84%, Moonshot의 Kimi-K2의 경우 88%에서 하나 이상의 허위 주장이 나타났습니다.
연구원들은 에이전트가 다시 시도하기 전에 이전 입찰 라운드에서 배울 수 있도록 허용했습니다. 연구에 따르면 세 가지 중국 모델의 경우 속임수가 12~20% 포인트 증가한 것으로 나타났습니다. 테스트에 포함된 미국 기업의 모델도 비슷한 결과를 보였습니다.
이번 훈련은 가상이었지만 베이징의 실제 계획과 유사했다. 지난 5월 발표된 정부 지침에는 입찰과 입찰이 AI 에이전트를 배치할 수 있는 영역으로 나열되어 있습니다.
2025년 12월에 발표되고 올해 국제 머신러닝 컨퍼런스에서 발표된 또 다른 연구에서는 중국과 미국 모델을 기반으로 하는 11개의 AI 에이전트가 손상된 도구, 누락된 파일 및 기타 장애물에 직면했을 때 어떻게 대처했는지 조사했습니다.
실패를 인정하는 대신 중국과 미국 AI 시스템을 모두 사용하는 에이전트는 답변 추측, 소스 대체, 결과 시뮬레이션 및 파일 조작을 포함하여 문제를 해결하기 위한 다양한 기술을 선택했습니다.
이 연구를 수행한 상하이 AI 연구소와 홍콩 과학 기술 대학의 연구원들은 로이터 통신에 이 행동이 AI가 정보를 만들어내고 이를 사실로 제시하는 AI 환각과 다르다고 말했습니다. 왜냐하면 이 경우 에이전트는 작업이 실패했거나 요청한 대로 완료할 수 없음을 보여주는 정보를 보유하고 있기 때문입니다.
브레이크아웃과 호환되는 행동
Reuters가 검토한 다른 연구 문서에는 중국 기반 에이전트가 작업을 달성하기 위해 테스트 환경 내에서 장벽을 뛰어넘거나 종료를 피하기 위해 조치를 취하는 것으로 나타났습니다. 이러한 동작은 브레이크아웃이 발생하지 않은 경우에도 테스트 환경을 벗어나려는 노력과 호환됩니다.
상하이에 본사를 둔 푸단대학교 연구원들은 2025년 3월 Alibaba의 Qwen2.5-72B-Instruct로 구동되는 AI 시스템이 교체될 것이라는 정보를 접한 후 복제하라는 지시 없이 다른 컴퓨팅 환경에서 자체 복사본을 생성했다고 보고했습니다. 다른 테스트에서는 폐쇄 후에도 살아남을 수 있는 전략을 고안했습니다.
중국, 미국, 프랑스 모델로 구동되는 에이전트가 포함된 실험은 통제되었으며 AI 에이전트가 더 넓은 웹으로 탈출하거나 중지가 불가능해지는 모습을 보여주지 않았습니다.
3월에 언론에 더 광범위하게 보도된 몇 안 되는 사례 중 하나인 Alibaba와 연결된 ROME 에이전트를 개발하는 연구원들은 이 에이전트가 암호화폐 채굴을 위해 컴퓨팅 리소스를 전환하거나 지시받지 않고 Alibaba Cloud 컴퓨터에서 외부 시스템으로의 연결을 설정했다고 밝혔습니다.
보안 시스템이 해당 활동을 감지하고 중지했습니다. 에이전트가 외부 컴퓨터에 존재했거나 더 넓은 웹으로 확산되었다는 증거는 없었습니다. 그러나 이 예는 시스템이 인간의 지시를 회피하고 잠재적으로 실제 경제로의 길을 찾을 수 있음을 보여주었습니다.
중국의 DeepSeek은 지난 9월 생산 교육 시스템의 에이전트가 의도하지 않은 채널을 통해 답변을 구하고 사용자 요청을 위조하고 안전 장치를 우회하려고 했으며 이로 인해 회사가 액세스 제어를 강화했다고 밝혔습니다.
중국은 지난 5월 에이전트가 승인된 경계 내에 머물고 시스템이 비정상적인 행동을 차단하도록 요구하는 지침을 발표했습니다. 민감하다고 간주되는 분야나 주요 산업 분야의 에이전트는 추가 테스트 및 제품 리콜 요구 사항에 직면할 수 있다고 말했습니다.
9월 14일 CAC의 지침에 따라 발표된 중국의 AI 안전 거버넌스 프레임워크 3.0은 에이전트가 독립적으로 리소스 또는 권한을 획득하고, 평가자를 속이고, 기능을 은폐하고, 고립된 컴퓨터 환경에서 약점을 악용하는 등의 위험을 식별했습니다.
일부 미국 경영진의 경기 둔화 요청에 대해 중국 연구원과 국영 언론은 가장 진보된 AI 모델의 개발 속도를 늦추는 것이 단순히 미국 기업의 기술 우위를 유지하는 데 도움이 될 수 있다고 말했습니다.
그럼에도 불구하고 중국 AI 연구소에 정통한 두 소식통은 알리바바(Alibaba), Z.ai, 샤오미(Xiaomi) 등 기업들이 내부 안전 평가팀을 구축해 왔다고 말했다.
Z.ai는 중국 AI 연구소에서 드물게 보안 침해 사건을 공개하면서 사용자 동의 없이 전체 로컬 코드 저장소를 해외 클라우드 서버에 비밀리에 업로드하고 있다는 사용자의 신고가 있은 후 이번 달 자사의 주력 AI 코딩 도우미의 일부 기능을 비활성화했다고 밝혔습니다.
Carnegie의 Singer는 중국이 재앙적 위험을 평가하기 위한 생태계 개발에서 미국보다 뒤처져 있으며 미국 개발자들이 훨씬 더 많은 자발적인 테스트를 수행하고 있다고 말했습니다.
“중국의 경우 AI 안전에 대한 작업이 훨씬 더 새로운 것입니다.”라고 그는 말했습니다. “생태계가 덜 성숙했어요.”
이 주제에 대해 더 알고 싶다면 아래를 참고하세요