오픈AI, 아이언클래드 계약 업무로 AI 시험…11개 과제 평균 평가점수 55.0%
오픈AI가 계약 업무 소프트웨어에서 AI 에이전트를 시험한 결과를 공개했다. 새 모델의 과제별 평균 평가점수는 이전 모델보다 높았지만, 제한된 연구 과제와 추정 작업시간을 실제 고객 성과로 볼 수는 없다.

오픈AI가 6일 아이언클래드의 계약 업무 소프트웨어에서 AI 에이전트를 훈련·평가한 연구 결과를 발표했다. 새 모델 GPT-6 아스트라의 11개 과제 평균 평가점수는 55.0%였다. 회사가 제시한 이전 모델 GPT-5.6 솔의 41.6%보다 높지만, 계약 업무를 자동으로 끝낸 비율은 아니다.
계약서 작성보다 업무 규칙 설정에 초점
오픈AI와 아이언클래드는 비밀유지계약 설정, 구매 승인 절차 구성, 관할 지역에 따른 표준 조항 변경 등을 과제로 골랐다. 과제별로 8~50개 기준을 적용해 요구사항을 얼마나 충족했는지 점수를 매겼다. 회사는 아이언클래드가 제공한 실습 환경과 합성 훈련 과제를 활용했다고 밝혔다.
두 모델은 같은 추론 설정으로 비교되지 않았다. 아스트라에는 ‘Max’, 솔에는 ‘High’를 적용했다. 과제당 평균 작업시간도 아스트라 19.2분, 솔 37.0분으로 제시됐으나 실제 고객이 아낀 시간을 측정한 값이 아니라 모델 처리 속도 등을 가정한 추정치다.
독립적인 기술 분석가 로히트 라마찬드란은 이 점수가 과제 기준을 일부 충족한 경우까지 반영하며, 계약서가 자동 처리된 비율로 읽어선 안 된다고 지적했다. 공개 자료만으로는 평가 과제와 채점 기준 전체를 재현하거나 고객 환경에서 성과를 확인할 수 없다.
8일 예정된 제품 기능과 연구 성적은 별개
아이언클래드의 10월 제품 안내에는 ‘워크플로 디자이너 에이전트’를 8일부터 제공할 예정이라고 적혔다. 관리자는 자연어로 양식 필드와 승인 조건 등을 구성할 수 있으나, 회사 단위 설정은 기본적으로 꺼져 있고 관리자가 켜야 한다. 아이언클래드는 변경 사항을 저장하거나 게시하기 전에 검토하라고 안내했다.
오픈AI의 연구 결과가 이 제품 기능의 성능을 검증한 것은 아니다. 연구의 제한된 과제에서 점수가 올랐다는 발표와 실제 조직의 승인 규칙을 지키며 운영할 수 있는지는 구분해야 한다.
대표 이미지: AI 생성 이미지 / 데이마크
출처: https://openai.com/index/advancing-computer-use-with-ironclad
https://support.ironcladapp.com/hc/en-us/articles/43400038871831-What-s-New-in-Ironclad-October-2026
https://rohitai.com/blog/openai-ironclad-computer-use-contracting-agent-evals


