앤트로픽 “GLM-5.3, 모의 공격서 악성 요청 차단 우회”…미 NIST도 사이버 역량 평가
앤트로픽이 중국 Z.ai의 공개 가중치 AI 모델 GLM-5.3을 시험해 악성 요청 방어의 취약성을 제기했다. 미국 NIST의 별도 평가도 높은 공격 역량을 확인했지만, 두 기관의 시험 조건과 비교 대상은 다르다.

앤트로픽이 29일 중국 Z.ai의 인공지능 모델 GLM-5.3에 대한 사이버보안 평가를 공개했다. 통제된 시험 환경에서 이 모델이 알려진 취약점을 이용하는 공격 코드를 만들었고, 유해 요청 거부 장치도 우회할 수 있었다는 내용이다. 실제 공격 발생률이나 모든 이용 조건에서의 성능을 측정한 결과는 아니다.
알려진 취약점으로 완성한 공격
앤트로픽은 크롬의 V8 엔진에 있는 알려진 취약점을 대상으로 한 ExploitBench에서 GLM-5.3이 410차례 시도 중 50차례 공격 코드를 완성했다고 밝혔다. 자사가 제한적으로 제공하는 클로드 미토스 프리뷰는 같은 평가에서 56차례 성공했다. 대상은 41개 취약점으로, 각 취약점에 여러 차례 시도한 결과다.
연구진은 격리된 오프라인 환경에서 시험했다고 명시했다. 이 수치를 인터넷상의 임의 시스템을 뚫을 확률로 읽을 수는 없다. 앤트로픽은 연구자가 모델을 활용해 브라우저의 미공개 취약점을 찾은 사례도 소개했지만, 해당 결함의 다른 운영체제 영향은 확인이 아닌 가능성으로 설명했다.
안전장치 평가는 별도 시험
앤트로픽은 유해한 사이버 공격 지시를 변형해 제시하거나 모델의 거부 반응을 줄이는 방식으로 GLM-5.3의 방어를 시험했다. 회사가 공개한 모의 시험에서 일부 기법의 우회 비율은 64~100%였다. 이는 시험한 요청과 설정에 관한 수치로, 모든 실제 공격이 성공했다는 뜻은 아니다. 경쟁 모델인 클로드와의 비교도 앤트로픽 자체 시험이라는 점을 고려해야 한다.
미국 국립표준기술연구소(NIST) 산하 CAISI는 앞서 17일 별도 평가에서 GLM-5.3을 당시 공개된 가중치 모델 중 사이버 과제 수행 역량이 가장 높은 모델로 분류했다. 다만 CAISI는 미국의 최상위 모델보다는 종합 지표에서 약 4개월 뒤처진다고 평가했다. 그 비교에는 제한적으로 제공되는 모델도 포함됐고, 해당 미국 모델들은 적용 가능한 경우 사이버 안전장치를 끈 채 시험했다.
GLM-5.3의 가중치 공개는 이용자가 자체 환경에서 모델을 실행·변형할 수 있다는 의미다. 두 평가의 지표는 공격 코드 작성 능력과 유해 요청 거부 성능을 각각 다루므로 서로 같은 척도로 합칠 수 없다. 앤트로픽의 우려는 모의 시험과 모델 접근성에 근거한 위험 평가이지 실제 악용 규모에 대한 확인은 아니다.
대표 이미지: AI 생성 이미지 / 데이마크
출처: https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
출처: https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities


