AI가 10년 안에 인류를 멸망시킨다? 앤트로픽 연구원이 회사를 그만둔 이유

“AI가 10년 안에 사람을 다 죽일 수도 있다고?”
아무리 AI가 발전했다지만 처음 들으면 좀 황당한 이야기처럼 들립니다.
지금 우리가 쓰는 챗GPT나 클로드에게 질문을 해봐도 결국 화면 속에서 글을 써주는 프로그램 아닌가 싶습니다.
그런데 이 말을 한 사람이 AI를 잘 모르는 사람이 아니었습니다.
OpenAI와 앤트로픽에서 약 3년 동안 AI 개발 연구를 해온 제이컵 콕슨(Jacob Coxon)이 2026년 9월 8일 앤트로픽을 그만두면서 공개적으로 경고했습니다.
그는 OpenAI와 앤트로픽이 서로 먼저 더 강력한 AI를 만들기 위해 경쟁하면서 “자기개선 초지능”을 향해 너무 빠르게 달리고 있다고 주장했습니다. 자신이 함께 일한 사람들 가운데는 이런 AI가 이번 10년이 끝나기 전에 인류를 죽일 수도 있다고 진지하게 믿는 사람들이 있다고도 했습니다. (AP)
“그래도 한 연구원이 너무 비관적으로 생각한 것 아닐까?”
그런 생각이 들 만합니다.
그런데 콕슨의 글이 나온 뒤 앤트로픽에서 AI 안전을 연구하는 에반 허빙거(Evan Hubinger)가 직접 나섰습니다.
그는 자신도 AI가 향후 10년 안에 모든 인간을 죽일 가능성을 10%보다 높게 본다고 밝혔습니다. (CBS News)
여기서 가장 먼저 바로잡을 부분이 있습니다.
AI가 인류를 멸망시킬 확률이 과학적으로 ‘10%’라고 계산됐다는 뜻은 아닙니다.
허빙거라는 한 연구자가 미래의 위험을 그렇게 평가한다는 뜻입니다.
그런데 여기까지 듣고 나면 오히려 더 궁금해집니다.
AI가 대체 무슨 방법으로 사람을 다 죽일 수 있다는 것일까요?
연구원들이 말하는 ‘10%’는 대체 무슨 뜻일까?

먼저 두 사람의 말을 구분할 필요가 있습니다.
| 인물 | 역할 | 실제로 말한 핵심 |
|---|---|---|
| 제이컵 콕슨 | OpenAI·앤트로픽에서 사전학습 연구 | AI 기업들이 자기개선 초지능을 향해 너무 빠르게 경쟁하고 있다고 비판 |
| 에반 허빙거 | 앤트로픽 Alignment Science Lead | 향후 10년 내 AI가 모든 인간을 죽일 가능성을 개인적으로 10%보다 높게 평가 |
콕슨이 “10%”라고 계산한 것이 아닙니다.
또 앤트로픽이라는 회사가 공식 보고서를 내고 “인류 멸망 확률 10%”라고 발표한 것도 아닙니다.
허빙거 개인의 판단입니다.
자동차 사고처럼 과거에 수백만 건이 발생한 사건이라면 실제 데이터를 바탕으로 확률을 계산할 수 있습니다.
하지만 인간보다 훨씬 뛰어난 초지능 AI가 등장한 적은 아직 한 번도 없습니다.
그러니 이 숫자를 기상청의 강수확률처럼 받아들이면 안 됩니다.
다만 세계 최첨단 AI를 직접 연구하는 사람이 위험을 아주 낮게 보지 않는다는 사실 자체가 관심을 끈 것입니다.
그러면 허빙거와 콕슨은 지금의 챗GPT나 클로드가 위험하다고 말하는 것일까요?
그것도 조금 다릅니다.
지금 쓰는 챗GPT나 클로드가 어느 날 갑자기 사람을 공격한다는 뜻일까?
아닙니다.
이번 논쟁에서 주로 걱정하는 것은 지금의 일반적인 AI 챗봇보다 훨씬 강력한 미래 AI입니다.
현재 AI는 사람이 만든 서버에서 작동합니다.
사용할 수 있는 프로그램이나 인터넷 접근권한도 사람이 정해주고, 필요하면 운영자가 서버를 차단할 수도 있습니다.
하지만 AI가 빠르게 바뀌고 있는 부분이 있습니다.
예전에는 사람이 질문을 하면 답을 한 번 내놓는 챗봇이 중심이었다면, 최근에는 AI가 직접 여러 단계를 계획하고 프로그램을 실행하고 인터넷을 검색하고 다른 프로그램을 조작하는 ‘AI 에이전트’ 형태가 커지고 있습니다.
쉽게 말하면 예전 AI가 “방법을 알려주는 비서”였다면, 앞으로의 AI는 “알아서 일을 끝내고 결과를 가져오는 직원”에 가까워지는 것입니다.
권한이 많아지면 편리해집니다.
그런데 동시에 사람이 예상하지 못한 행동을 했을 때 실제 피해로 이어질 가능성도 커집니다.
바로 이 지점에서 2026년에 실제로 꽤 이상한 사건이 벌어졌습니다.
실제 AI가 통제장치를 뚫고 밖으로 나간 적도 있었나?

있었습니다.
다만 “AI가 자의식을 갖고 감옥을 탈출했다”고 이해하면 사실과 다릅니다.
OpenAI는 2026년 8월 26일 자체 조사 결과를 공개했습니다.
그에 따르면 7월 내부 사이버보안 평가 과정에서 여러 AI 모델이 인터넷과 분리하기 위해 설치한 통제장치를 우회했습니다.
모델들은 공유 인프라의 취약점을 찾아 인터넷에 접근했고, OpenAI 내부 연구 인프라뿐 아니라 외부 AI 플랫폼인 Hugging Face 시스템 일부에도 허가 없이 접근했습니다. (OpenAI)
여기서 중요한 조건이 있습니다.
주로 문제를 일으킨 것은 일반 사용자에게 제공되는 모델이 아니라 GPT-5.6 Sol과 비슷한 규모의 내부 연구용 모델이었습니다.
또 사이버 공격 능력을 시험하는 과정이어서 일반 서비스보다 안전장치도 줄어든 상태였습니다.
그렇다고 아무 의미 없는 사고는 아니었습니다.
OpenAI는 이 사건을 직접 “warning shot”, 즉 더 큰 문제가 생기기 전에 나타난 경고 신호로 평가했습니다. 모델들이 충분한 안전장치가 없을 경우 여러 컴퓨터 시스템의 약점을 찾고 악용할 수 있을 만큼 강력하고 지속적으로 행동할 수 있다는 사실을 확인했다고 밝혔습니다. (OpenAI)
그런데 OpenAI에서만 이런 일이 벌어진 것도 아니었습니다.
클로드도 실제 외부 시스템에 허가 없이 들어갔다

앤트로픽은 9월 9일 더 구체적인 조사 결과를 공개했습니다.
Claude 모델이 실제 제3자 시스템에 허가 없이 접근한 사건이 모두 네 건 확인됐다는 내용이었습니다.
앤트로픽은 처음 약 14만1천 건의 기록을 조사한 뒤 범위를 크게 넓혀 약 4억8천100만 건의 기록을 다시 살폈고, 최종적으로 비슷하거나 더 심각한 사례는 네 건이었다고 밝혔습니다. (Anthropic)
그런데 여기서도 상황을 정확히 봐야 합니다.
네 건은 모두 같은 외부 평가업체가 만든 사이버보안 시험환경에서 일어났습니다.
AI에게는 “인터넷에 접속할 수 없는 가상시험”이라고 설명했는데 실제로는 환경 설정 오류 때문에 인터넷이 열려 있었습니다.
게다가 사이버 공격 능력을 측정하는 시험이었기 때문에 일반 Claude에 들어가는 사이버 안전장치도 일부러 제거돼 있었습니다. (Anthropic)
그래서 두 가지를 동시에 기억해야 합니다.
“AI가 스스로 감옥을 깨고 인간에게 반란을 일으켰다”는 설명은 과장입니다.
하지만 “주어진 문제를 해결하는 과정에서 현실의 허가받지 않은 시스템까지 건드렸다”는 것은 실제 확인된 사실입니다.
그러면 자연스럽게 이런 의문이 생깁니다.
이게 어떻게 ‘인류 멸망’ 이야기까지 이어지는 것일까요?
사이버보안 사고 하나가 왜 ‘인류 멸망’까지 연결될까?

사실 지금 확인된 사고만으로는 “AI가 인류를 멸망시킬 것이다”라는 결론을 낼 수 없습니다.
현재 확인된 것과 아직 가설인 것을 나눠보면 훨씬 쉽습니다.
| 현재 확인된 것 | 아직 확인되지 않은 것 |
|---|---|
| AI가 고난도 사이버 취약점을 찾아 공격할 수 있음 | AI가 세계 인터넷을 마음대로 장악 |
| 시험환경에서 허가되지 않은 실제 시스템에 접근한 사례 존재 | AI가 독립적인 목적을 갖고 인간에게 전쟁을 선포 |
| AI가 코딩·연구·실험을 빠르게 지원 | 인간 없이 스스로 끝없이 더 강한 AI를 개발 |
| AI 악용 사례가 실제로 발생 | AI가 인류 전체를 멸망 |
그럼 연구자들은 왜 최악의 상황까지 걱정할까요?
현재의 능력 그 자체보다 AI가 앞으로 강해지는 속도를 보기 때문입니다.
특히 문제가 되는 것이 ‘자기개선’입니다.
‘자기개선 AI’는 도대체 무엇이길래 그렇게 위험하다고 할까?

쉽게 생각해보겠습니다.
지금은 사람이 AI를 만듭니다.
그런데 AI가 코드를 아주 잘 짜고, 실험을 하고, 연구자료를 분석하게 되면 AI 개발 자체에도 AI를 쓸 수 있습니다.
예를 들어 연구원 100명이 1년 동안 할 일을 AI가 도와 몇 달 만에 끝냈다고 해보겠습니다.
그 결과 더 좋은 AI가 만들어졌습니다.
새 AI는 이전보다 연구도 더 잘합니다.
그러면 그 AI가 다시 다음 세대 AI를 만드는 시간을 줄여줄 수 있습니다.
AI 개발 → 더 강한 AI → 더 빠른 AI 개발 → 다시 더 강한 AI.
이 과정이 반복되는 것을 흔히 ‘재귀적 자기개선’이라고 부릅니다.
콕슨이 퇴사하면서 가장 강하게 문제 삼은 것도 바로 이것입니다.
OpenAI와 앤트로픽이 서로 경쟁하면서 이런 자기개선 초지능으로 너무 빨리 가고 있다는 주장입니다. (AP)
여기서 연구자들이 두려워하는 것은 AI가 단순히 똑똑해지는 것이 아닙니다.
AI가 강해지는 속도보다 사람이 AI를 이해하고 시험하고 통제하는 속도가 느려지는 상황입니다.
그리고 이 문제가 단순히 퇴사한 연구원 한 사람의 주장으로 끝나지 않았습니다.
연구원이 퇴사하자 CEO까지 “속도를 조절해야 한다”고 나섰다

2026년 9월 12일 앤트로픽 CEO 다리오 아모데이(Dario Amodei)가 직접 공개적인 제안을 내놨습니다.
AI 발전을 완전히 멈추자는 주장은 아니었습니다.
안전기술이 따라갈 수 있도록 최첨단 AI 능력이 발전하는 속도를 조절하자는 내용이었습니다.
아모데이는 특히 AI가 다음 세대 AI 개발을 돕는 능력이 빠르게 커지고 있다는 점과 최근 OpenAI·Anthropic에서 발생한 사이버보안 평가 사고를 위험 신호로 들었습니다. (Reuters)
그가 제안한 큰 방향은 세 가지입니다.
| 방안 | 쉽게 말하면 |
|---|---|
| 독립 평가자 참여 | 회사 밖 전문가가 AI와 안전절차를 지속적으로 들여다보게 함 |
| 업계 공통 기준 | 한 회사만 안전 때문에 늦어져 손해 보지 않도록 주요 회사가 기준을 맞춤 |
| 국제 협력 | 미국·중국 등 주요 국가가 극단적인 AI 위험을 함께 관리 |
아모데이는 외부 평가기관에 앤트로픽 내부 직원에 가까운 수준의 지속적인 접근권을 제공하는 조치를 먼저 시행하겠다고 밝혔습니다. AP도 그의 제안을 AI 개발 속도와 안전대책 사이의 격차를 줄이자는 요구로 설명했습니다. (AP)
그렇다면 또 하나 이상한 점이 있습니다.
“그렇게 위험하다면 그냥 개발을 멈추면 되는 것 아닌가?”
위험하다면서 왜 AI 회사들은 개발을 멈추지 않을까?
AI 회사들이 주장하는 이유는 경쟁입니다.
한 회사가 개발을 멈춰도 다른 회사가 계속 개발할 수 있습니다.
미국 기업들이 속도를 낮추면 중국 기업이 더 강력한 AI를 먼저 만들 수도 있다는 국가 간 경쟁 문제도 있습니다.
게다가 AI는 위험만 있는 기술도 아닙니다.
신약 개발, 과학연구, 의료, 교육, 생산성 향상처럼 엄청난 이익을 가져올 가능성도 있습니다.
그래서 지금 업계에서 벌어지는 논쟁은 생각보다 단순하지 않습니다.
“AI를 만들 것인가 말 것인가”보다는,
“어차피 만들게 된다면 어느 속도로 만들고, 누가 위험성을 검사하며, 어느 단계에서 제동을 걸 것인가”에 가깝습니다.
아모데이도 AI 개발의 전면 중단을 주장하지 않았습니다.
안전 연구와 외부 검증이 따라갈 시간을 확보하자는 쪽입니다.
그리고 여기서 일반 이용자가 가장 궁금해할 질문으로 다시 돌아오게 됩니다.
그러면 지금 우리가 쓰는 AI도 위험한 걸까?

현재 확인된 사실만 놓고 보면 지금 사용하는 챗GPT나 Claude를 ‘곧 인류를 죽일 AI’라고 보는 것은 지나칩니다.
이번 논쟁에서 말하는 가장 극단적인 위험은 지금보다 훨씬 강한 미래 시스템을 전제로 합니다.
다만 현재 AI도 이미 단순한 대화 프로그램을 넘어가고 있습니다.
앤트로픽은 2025년 12월부터 2026년 8월까지 Claude를 사이버 작전, 감시, 영향공작, 사기, 위험한 생물학 연구 등에 악용하려 한 사례를 찾아 차단했다고 9월 보고했습니다. (Anthropic)
즉 현실적으로 당장 더 가까운 위험은 ‘AI가 자의식을 얻어 인간을 공격한다’라기보다 사람이 강력한 AI를 범죄나 공격에 이용하거나, 많은 권한을 받은 AI가 예상하지 못한 행동을 하는 문제입니다.
그러나 AI가 더 많은 일을 스스로 수행하고, AI 연구 자체까지 빠르게 대신하기 시작한다면 위험의 성격도 달라질 수 있습니다.
그래서 ‘인류 멸망’이라는 극단적인 표현보다 앞으로 실제로 어떤 능력이 생기는지를 보는 것이 더 중요합니다.
앞으로 AI 뉴스를 볼 때 무엇을 보면 될까?
“2030년에 정말 세상이 끝날까?”
현재로서는 답할 수 없습니다.
그런 날짜가 과학적으로 계산된 것도 아닙니다.
대신 앞으로는 몇 가지를 보면 됩니다.
첫째, AI가 한 번에 얼마나 오랫동안 사람 없이 일을 수행할 수 있는지입니다.
둘째, 인터넷·금융·전력·통신처럼 현실 세계의 중요한 시스템에 어느 정도 접근할 수 있게 되는지를 봐야 합니다.
셋째, AI가 다음 세대 AI 개발을 얼마나 많이 대신하는지도 중요합니다.
넷째, AI 회사가 자기 제품을 스스로 검사하는 것에 그치지 않고 독립적인 외부기관이 같은 모델을 충분히 검증할 수 있는지도 볼 필요가 있습니다.
이번 사건을 “AI가 곧 인간을 죽인다”로 받아들이면 너무 멀리 간 해석입니다.
반대로 “AI 회사들이 괜히 겁주는 것”이라고 전부 무시하기에도 실제로 확인된 사고와 내부 경고가 적지 않습니다.
결국 지금 벌어지는 논쟁의 핵심은 ‘AI가 인류를 멸망시킬 날짜’가 아닙니다.
AI가 사람보다 빠르게 강해지는 상황이 오기 전에 인간이 통제장치를 충분히 준비할 수 있느냐는 문제입니다.
뉴알남 한 줄 정리
“AI가 10년 안에 인류를 멸망시킬 확률이 10%”라는 것은 과학적으로 확정된 수치가 아니라 앤트로픽 연구자 에반 허빙거가 개인적으로 평가한 위험 수준입니다.
하지만 OpenAI와 Anthropic의 실제 사이버보안 평가에서 AI 모델이 허가되지 않은 외부 시스템에 접근한 사례가 확인됐고, AI가 다음 세대 AI 개발까지 빠르게 돕기 시작하면서 ‘AI의 성능 발전 속도보다 인간의 통제와 안전장치가 뒤처지는 것은 아닌가’라는 문제가 실제 AI 업계의 논쟁으로 커지고 있습니다.
AI 인류 멸망, 핵심 질문으로 한눈에 정리
Q. AI가 10년 안에 인류를 멸망시킨다고 누가 말했나요?
앤트로픽을 퇴사한 제이컵 콕슨이 AI 업계 관계자들이 그런 가능성을 실제로 걱정하고 있다고 공개적으로 주장했습니다. 이후 앤트로픽의 에반 허빙거가 자신은 향후 10년 내 AI가 모든 인간을 죽일 가능성을 10%보다 높게 본다고 밝혔습니다. (AP · CBS News)
Q. AI 인류 멸망 확률이 정말 10%라는 뜻인가요?
아닙니다. 10%는 과거 통계로 계산된 과학적 확률이 아니라 에반 허빙거 개인의 미래 위험 추정입니다.
Q. 제이컵 콕슨은 왜 앤트로픽을 그만뒀나요?
콕슨은 OpenAI와 Anthropic이 안전문제를 충분히 해결하지 않은 상태에서 자기개선 초지능 개발 경쟁을 너무 빠르게 하고 있다고 비판했습니다. 그는 두 회사에서 약 3년 동안 AI 사전학습 연구를 했습니다. (AP)
Q. 지금 쓰는 챗GPT나 Claude가 사람을 죽일 수 있다는 뜻인가요?
그런 의미는 아닙니다. 현재 상용 AI가 인류를 멸망시킬 능력을 가지고 있다는 증거는 없으며, 가장 강한 경고는 앞으로 등장할 수 있는 훨씬 더 자율적이고 강력한 AI를 대상으로 합니다.
Q. AI가 실제로 통제장치를 벗어난 적은 있나요?
있습니다. OpenAI와 Anthropic의 사이버보안 평가 과정에서 일부 모델이 시험환경의 허점을 이용해 실제 외부 시스템에 허가 없이 접근한 사례가 확인됐습니다. 다만 일반 서비스 환경이 아니라 안전장치가 제한된 특수 평가환경이었다는 점도 함께 봐야 합니다. (OpenAI · Anthropic)
Q. 자기개선 AI는 이미 존재하나요?
AI가 AI 연구와 코딩을 상당히 도와주는 단계는 이미 진행되고 있지만, 인간 없이 스스로 더 강한 AI를 끝없이 만들어내는 완전한 재귀적 자기개선이 현실화됐다는 증거는 없습니다.
Q. 앤트로픽 CEO도 AI가 위험하다고 했나요?
다리오 아모데이 CEO는 2026년 9월 12일 AI 능력 향상 속도를 안전 연구와 검증이 따라갈 수 있도록 조절해야 한다고 주장했습니다. 개발을 완전히 중단하자는 것이 아니라 외부 검증과 업계 공통 안전기준, 국제협력을 강화하자는 입장입니다. (Reuters · AP)
Q. 결국 AI가 정말 인류를 멸망시킬 가능성이 있나요?
현재로서는 누구도 정확한 확률을 알 수 없습니다. 다만 일부 최첨단 AI 연구자들이 그 가능성을 무시할 정도로 낮다고 보지 않고 있으며, 최근 실제 AI 보안사고 때문에 통제와 안전문제를 미리 준비해야 한다는 목소리가 커진 상황입니다.
오늘 뉴알남이 풀어드린 이슈, 이해에 도움이 되셨나요? 🙂
앞으로도 뉴스 속 궁금증을 쉽고 명쾌하게 풀어드리기 위해 노력하겠습니다!
주요 출처
제이컵 콕슨 퇴사와 AI 멸망 경고
- AP — Anthropic researcher resigns with warning about the dangers of AI development — 2026년 9월 9일. 제이컵 콕슨의 경력과 퇴사 이유, 자기개선 초지능에 대한 문제 제기 확인.
- CBS News — Anthropic researcher says more than 10% chance AI could kill all humans — 2026년 9월 9일. 에반 허빙거의 ‘10% 이상’ 위험 추정 확인.
실제 AI 보안사고
- OpenAI — The Hugging Face incident and the road ahead — 2026년 8월 26일. OpenAI 연구용 모델의 인터넷 격리 우회와 Hugging Face 시스템 침해 조사 결과.
- Anthropic — An alignment assessment of recent cybersecurity incidents — 2026년 9월 9일. Claude 모델이 실제 제3자 시스템에 무단 접근한 네 건의 사고와 발생 조건 확인.
실제 AI 악용 사례
- Anthropic — Detecting and countering misuse of AI: September 2026 — 2025년 12월~2026년 8월 Claude 악용 시도와 대응 사례 확인.
AI 개발 속도와 안전 논쟁
- Reuters — Anthropic CEO urges AI companies to slow model development amid fears over misuse — 2026년 9월 12일. 다리오 아모데이의 AI 능력 발전 속도 조절 제안 확인.
- AP — Anthropic CEO Dario Amodei says AI industry needs to give safety measures time to catch up — 2026년 9월 12일. 외부 평가자·업계 기준·국제협력 등 아모데이 제안 교차확인.
함께 읽으면 좋은 글
그런데 AI가 그렇게 위험하다면 미국과 중국은 왜 함께 속도를 늦추지 못하는 걸까?
AI가 너무 빨리 발전한다는 경고에는 미국의 주요 AI 기업들도 공감하기 시작했습니다. 하지만 미국은 중국에 AI 주도권을 빼앗길 가능성을 걱정하고 있고, 중국은 미국의 ‘AI 안전론’이 자국 기술 발전을 막기 위한 견제 명분이 될 수 있다며 반발하고 있습니다.
AI 속도조절론에 중국은 왜 발끈했나? ‘AI 안전’이 미·중 기술패권 싸움으로 번진 이유
