오픈AI, 아이언클래드 계약 업무로 AI 시험…11개 과제 평균 평가점수 55.0%

오픈AI가 계약 업무 소프트웨어에서 AI 에이전트를 시험한 결과를 공개했다. 새 모델의 과제별 평균 평가점수는 이전 모델보다 높았지만, 제한된 연구 과제와 추정 작업시간을 실제 고객 성과로 볼 수는 없다.

창가 책상 위 노트북 화면에 글자 없는 업무 흐름도가 보이고, 옆에 파일과 종이가 놓여 있다
창가 책상 위 노트북 화면에 글자 없는 업무 흐름도가 보이고, 옆에 파일과 종이가 놓여 있다. 사진은 기사 이해를 돕기 위한 자료 이미지입니다.

오픈AI가 6일 아이언클래드의 계약 업무 소프트웨어에서 AI 에이전트를 훈련·평가한 연구 결과를 발표했다. 새 모델 GPT-6 아스트라의 11개 과제 평균 평가점수는 55.0%였다. 회사가 제시한 이전 모델 GPT-5.6 솔의 41.6%보다 높지만, 계약 업무를 자동으로 끝낸 비율은 아니다.

계약서 작성보다 업무 규칙 설정에 초점

오픈AI와 아이언클래드는 비밀유지계약 설정, 구매 승인 절차 구성, 관할 지역에 따른 표준 조항 변경 등을 과제로 골랐다. 과제별로 8~50개 기준을 적용해 요구사항을 얼마나 충족했는지 점수를 매겼다. 회사는 아이언클래드가 제공한 실습 환경과 합성 훈련 과제를 활용했다고 밝혔다.

두 모델은 같은 추론 설정으로 비교되지 않았다. 아스트라에는 ‘Max’, 솔에는 ‘High’를 적용했다. 과제당 평균 작업시간도 아스트라 19.2분, 솔 37.0분으로 제시됐으나 실제 고객이 아낀 시간을 측정한 값이 아니라 모델 처리 속도 등을 가정한 추정치다.

독립적인 기술 분석가 로히트 라마찬드란은 이 점수가 과제 기준을 일부 충족한 경우까지 반영하며, 계약서가 자동 처리된 비율로 읽어선 안 된다고 지적했다. 공개 자료만으로는 평가 과제와 채점 기준 전체를 재현하거나 고객 환경에서 성과를 확인할 수 없다.

8일 예정된 제품 기능과 연구 성적은 별개

아이언클래드의 10월 제품 안내에는 ‘워크플로 디자이너 에이전트’를 8일부터 제공할 예정이라고 적혔다. 관리자는 자연어로 양식 필드와 승인 조건 등을 구성할 수 있으나, 회사 단위 설정은 기본적으로 꺼져 있고 관리자가 켜야 한다. 아이언클래드는 변경 사항을 저장하거나 게시하기 전에 검토하라고 안내했다.

오픈AI의 연구 결과가 이 제품 기능의 성능을 검증한 것은 아니다. 연구의 제한된 과제에서 점수가 올랐다는 발표와 실제 조직의 승인 규칙을 지키며 운영할 수 있는지는 구분해야 한다.

대표 이미지: AI 생성 이미지 / 데이마크

출처: https://openai.com/index/advancing-computer-use-with-ironclad

https://support.ironcladapp.com/hc/en-us/articles/43400038871831-What-s-New-in-Ironclad-October-2026

https://rohitai.com/blog/openai-ironclad-computer-use-contracting-agent-evals