13개 언어 웹 탐색 시험서 AI 최고 정답률 31.68%…검색 도구 따라 차이
연구진이 13개 언어의 웹 탐색 문제 423개를 만들어 AI 모델 5종을 시험했다. 자체 검색을 쓴 최고 점수는 31.68%였고, 검색 도구를 바꾸자 같은 모델의 성적도 달라졌다.

국제 공동연구진이 지난 2일(현지시간) 공개한 웹 탐색 AI 평가 연구에서 13개 언어로 작성한 난도 높은 문제 423개에 대한 최고 정답률은 31.68%로 나타났다. 같은 모델이라도 연결한 검색 도구에 따라 점수가 달라져, 평가 결과를 모델 자체의 능력으로만 읽기 어렵다는 분석이다.
연구진이 사전 공개 논문으로 낸 ‘하이퍼브라우즈컴프(HyperBrowseComp)’는 짧은 정답을 찾기 위해 여러 웹 자료를 대조하도록 설계됐다. 한국어 문제는 35개다. 글뿐 아니라 영상·지도·이미지·스캔 문서의 단서를 찾아야 하는 문항도 포함됐다. 원어민 또는 해당 언어에 능숙한 작성자가 문제를 만들고 다른 검수자가 근거와 답을 점검했다.
같은 모델, 검색 연결 바꾸자 정답률 변동
연구진은 웹 검색이 가능한 모델 5종에 제작사 자체 검색을 연결해 시험했다. 이 조건에서 제미나이 3.7 플래시는 423개 중 134개를 맞혀 31.68%를 기록했다. GPT-5.6 솔은 81개로 19.15%였다. 이는 연구진의 특정 문제와 도구 설정에서 나온 값으로 일반적인 검색 질문에 대한 정답률이 아니다.
외부 검색 서비스 엑사를 연결하자 GPT-5.6 솔의 정답률은 26.71%로 올라갔지만 제미나이 3.7 플래시는 22.22%로 떨어졌다. 연구진은 검색 결과를 가져오는 방식과 에이전트의 작업 흐름을 떼어놓고 모델 성능을 비교해서는 안 된다고 봤다. 엑사 조건의 토큰 사용량도 자체 검색 조건보다 많았다.
한국어 문항 35개…일상 검색 성능과 구분해야
원논문 표에는 한국어 문항 35개의 결과도 제시됐다. 다만 언어별로 문항 난도가 같도록 맞춘 시험은 아니어서 한국어 점수를 다른 언어의 성능 우열로 해석할 수 없다. 연구진은 실제 웹 검색 순위와 페이지 내용이 바뀌면 재시험 결과도 달라질 수 있다고 밝혔다.
앞서 오픈AI 연구진이 2025년 발표한 ‘브라우즈컴프’는 찾기 어려운 사실의 짧은 답을 요구하는 1266개 문제로 웹 탐색 능력을 평가했다. 새 연구는 다국어로 직접 작성한 문항과 비문자 자료를 결합했다는 점에서 시험 범위를 달리한다. 이번 논문은 동료심사를 거치지 않은 사전 공개본이며, 연구진이 시험한 모델·검색 도구 조합만으로 전체 AI 서비스의 순위를 매길 수 없다.
원문: https://arxiv.org/abs/2610.03574
배경 논문: https://arxiv.org/abs/2504.12516
대표 이미지: AI 생성 이미지 / 데이마크


