AI 모델 경쟁, 성능보다 ‘작업당 비용’으로 옮겨갔다
앤트로픽·오픈AI·xAI가 21~22일 새 AI 모델을 내놓으며 코딩·지식업무용 성능과 함께 토큰 가격, 캐시 비용, 작업당 비용을 전면에 내세웠다.

앤트로픽과 오픈AI, xAI가 21~22일 새 대형언어모델을 연이어 공개했다. 세 회사는 코딩과 지식업무, 장시간 에이전트 작업을 공통된 사용처로 제시했지만, 이번 경쟁의 전면에는 단일 벤치마크 점수보다 토큰 가격과 ‘작업당 비용’이 놓였다.
토큰 가격과 캐시 비용을 낮춘 세 회사
앤트로픽은 22일 Claude Opus 5.5를 내놨다. 앤트로픽의 공식 가격 문서는 이 모델의 API 가격을 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 안내한다. 캐시 읽기·갱신은 100만 토큰당 0.20달러다. 회사는 Opus 5.5를 장시간 작업용 상위 모델군에 배치했고, 연구 미리보기인 고속 모드에서는 입력 8달러·출력 40달러를 적용한다.
오픈AI는 같은 날 GPT-6 Sol과 GPT-6 Luna를 공개했다. 공식 발표에 따르면 Sol의 가격은 입력 100만 토큰당 2달러, 출력 10달러이고 Luna는 각각 0.10달러와 0.50달러다. 회사는 두 모델의 가격이 종전 GPT-5.6 Sol·Luna의 프로모션 가격보다 50% 낮아졌다고 밝혔다. Sol과 Luna는 API에서는 각각 gpt-6-sol, gpt-6-luna로 제공되며, Sol은 복잡한 업무용, Luna는 요약·추출처럼 목표가 분명한 대량 작업용으로 구분했다.
xAI는 하루 앞선 21일 Grok 4.7을 공개했다. xAI는 Grok 4.6과 같은 입력 2달러·출력 6달러(각각 100만 토큰 기준)로 제공한다고 밝혔다. 새 모델은 더 큰 기반 모델과 긴 강화학습 훈련을 바탕으로 긴 문맥과 자체 검증을 강화했다고 설명했다. 일반형보다 출력 속도를 두 배로 높인 고속형은 두 배 가격으로 운영한다.
같은 순위표로 읽기 어려운 공개 평가
세 회사의 숫자를 같은 순위표로 읽기는 어렵다. 공개 자료에 제시된 벤치마크는 시험 과제, 추론 노력 설정, 도구 수, 비용 산정 방식이 서로 다르다. 오픈AI의 AutomationBench·DeepSWE 결과와 xAI의 CursorBench·DeepSWE 결과는 각 회사가 선정한 조건에서 나온 수치다. 앤트로픽도 공식 가격 문서에서 캐시 읽기·쓰기, 고속 모드, 배치 처리 여부에 따라 단가가 달라진다고 명시한다.
이번 발표가 보여주는 변화는 모델 선택 기준의 이동이다. 코드 수정이나 문서 처리처럼 반복 호출이 많은 업무에서는 입력·출력 단가만이 아니라 캐시 적중률, 추론 단계, 도구 호출, 재시도 횟수, 실제 완료율을 함께 계산해야 한다. 회사가 제시한 ‘작업당 비용’은 비교의 출발점일 뿐, 도입 기업은 자체 데이터와 동일한 업무 조건에서 재현 시험을 해야 한다.
대표 이미지: AI 생성 이미지 / 데이마크


