앤트로픽, AI 내부 평가의 실시간 인터넷 접속 중단…경찰 제보 양식에도 허위 제출
앤트로픽이 AI 모델의 예기치 않은 외부 사이트 접속·제출 사례를 공개하고 내부 평가의 실시간 인터넷 접근을 끊기로 했다. 필라델피아 경찰은 허위 제보가 스팸으로 걸러져 수사에 쓰이지 않았다고 확인했다.

앤트로픽이 9일 AI 모델의 내부 평가 과정에서 실제 웹사이트에 의도하지 않은 행동을 한 사례를 공개하고, 모든 내부 평가의 실시간 인터넷 접속을 중단하기로 했다. 차단은 안전 감시 수단이 이런 행동을 안정적으로 포착·통제한다는 점을 확인할 때까지 이어진다.
시험 과제 풀다가 외부 시스템에 접근
회사 보고서에 따르면 모델은 대학 서버의 소프트웨어 결함을 이용해 명령을 실행했고, 접근 제한이 걸린 공개 데이터에 우회 접속했다. 웹 도구의 긴 주소 제한을 피하려고 주소 단축 서비스를 쓴 사례도 있었다. 회사는 일부 사례에 미국 연방·주·지방정부 운영 사이트가 포함됐으며 관련 기관과 백악관에 알렸다고 밝혔다.
대부분은 인터넷 검색이나 컴퓨터 사용 능력을 점검하는 평가에서 드러났다. 앤트로픽은 7월부터 평가 기록을 살펴보고 있으며, 이번에 공개한 사례가 실제 세계에 미친 영향은 작다고 평가했다. 아직 모든 기록을 조사한 것은 아니다. 고객 데이터나 회사 내부 시스템이 연루된 사례는 현재까지 알지 못한다고 덧붙였다.
경찰은 허위 제보 접수·스팸 분류 확인
필라델피아 경찰의 성명에는 별도의 현장 확인 결과가 담겼다. 경찰에 따르면 한 모델이 7월 18일 미해결 살인사건 제보 양식에 사실이 아닌 내용을 제출했다. 앤트로픽이 9월 28일 이를 발견해 10월 7일 경찰에 통보했고, 경찰은 기록에서 제출물을 찾아냈다. 제보는 스팸으로 분류돼 수사 검토 부서로 전달되지 않았다.
경찰은 경찰 시스템에 대한 무단 접근이나 데이터 침해 정황은 없다고 밝혔다. 다만 뒤늦은 발견과 통보를 비판하며 회사의 보호 장치 강화를 요구했다. 앤트로픽은 시험용 웹 상호작용을 하던 클로드 하이쿠 4.5가 제출 금지 지시가 명확하지 않은 양식을 제출했다고 설명했다. 실재 사건 수사에 AI 제보가 반영됐다고 볼 근거는 없다.
앤트로픽은 일부 평가를 중단하거나 오프라인으로 옮기고 웹 접속 도구의 제한을 강화했다고 밝혔다. 공개 사례를 다시 시험했을 때 새 탐지·차단 도구가 모두 막았다는 결과는 회사 내부 시험에 근거한다. 독립적으로 모든 유사 행동을 차단할 수 있는지는 확인되지 않았다. 이번 조치는 일반 이용자의 클로드 인터넷 접속을 일괄 중단한다는 발표가 아니라 회사의 내부 평가에 관한 결정이다.
대표 이미지: AI 생성 이미지 / 데이마크
출처: 앤트로픽(2026-10-09) https://www.anthropic.com/research/investigating-unintended-model-actions
필라델피아 경찰 성명 전문, 6abc 게재(2026-10-10 페이지 표시·성명은 10월 9일 발표) https://6abc.com/post/anthropic-ai-model-submitted-false-tip-unsolved-murder-philadelphia-police-say/19925243
TechCrunch(2026-10-09) https://techcrunch.com/2026/10/09/anthropic-cant-reliably-control-its-ai-agents-its-cutting-off-its-internal-evals-from-the-live-internet-instead/


