AI, 불가능한 역학 문제의 오류 짚고도 ‘해결’ 판정…30쌍 시험서 확인

미국 연구진이 역학 문제 30쌍으로 AI 14종의 전제 검증 능력을 시험했다. 최근 모델 3종은 잘못된 문제에 대한 답변 90건 중 12건에서 거부하지 않았고, 결과를 실제 설계 안전성 평가로 일반화할 수는 없다.

책상 위 금속 보와 다이얼 측정기, 열린 설계 노트와 닫힌 노트북
책상 위 금속 보와 다이얼 측정기, 열린 설계 노트와 닫힌 노트북. 사진은 기사 이해를 돕기 위한 자료 이미지입니다.

미국 산타클라라대 연구진이 5일 공개한 사전논문에서 일부 언어모델은 물리적으로 성립하지 않는 역학 문제의 모순을 지적하고도 최종 상태를 ‘해결’로 표시했다. 계산 결과만 읽어들이는 자동화 시스템이라면 경고 문장과 최종 판정이 어긋날 수 있다는 점을 보여준다.

연구진은 역학 문제 30개를 각각 성립하는 원본과 조건 하나를 바꿔 불가능하게 만든 문제로 짝지었다. 두 가지 풀이로 정답을 확인한 뒤 3개 제공사의 모델 14종에 문제를 제시했다. 답변에는 ‘해결’ 또는 ‘풀 수 없음’이라는 상태를 쓰게 했지만, 첫 질문에서 오류가 있을 수 있다고 미리 알리지는 않았다.

오류를 알아채도 최종 표시는 달랐다

최근 모델 3종이 잘못된 문제에 낸 답 90건 중 12건은 문제를 거부하지 않았다. 이 가운데 11건은 본문에서 모순을 지적한 뒤 조건을 고쳐 계산하면서도 원래 문제를 ‘해결’로 표시한 것으로 연구진이 분류했다. 이 분류에는 AI 판정자와 수치 점검이 쓰였다. 14종 전체의 실패율이나 실제 시설 사고율을 뜻하는 수치는 아니다.

연구진은 이후 한 업체의 모델 4종을 다시 시험하면서 ‘풀 수 없음’ 대신 ‘결함 있음’을 상태 선택지로 주고 결함 설명을 요구했다. 3종에서 오류 문제를 거부하는 비율이 유의하게 높아졌지만, 성립하는 문제를 푸는 성적은 3종에서 낮아졌다. 거부만 많이 하는 모델이 반드시 더 유용하다고 볼 수 없는 이유다.

실제 공학 현장 적용에는 거리

2025년 ACL 학회 논문도 별도의 오류 전제 시험에서 모델 15종이 별도 지시 없이 문제의 오류를 먼저 짚는 데 약하다고 보고했다. 다만 과제 구성과 모델이 달라 이번 역학 연구의 수치를 재현한 결과는 아니다.

이번 연구는 5개 유형의 역학 문제에 집중했고 동료 심사를 마치지 않은 사전논문이다. 계산 도구를 사용하는 실제 에이전트나 한국어 질문, 현장 설계에서는 같은 결과가 나오는지 확인하지 않았다. 연구진도 일부 실패 사례의 오류 인식·수정 여부를 전문가가 아니라 AI 평가자로 분류한 점을 한계로 적었다. 공학 자동화에 적용한다면 계산값뿐 아니라 전제 검증과 최종 상태 표시가 일치하는지 따로 시험할 필요가 있다는 해석이다.

대표 이미지: AI 생성 이미지 / 데이마크

출처: https://arxiv.org/abs/2610.06668

독립 맥락: https://aclanthology.org/2025.findings-emnlp.44/