Claude Opus 5.5가 나왔다. Anthropic은 9월 22일 발표에서 Opus 5보다 작업 비용이 40% 줄었다고 강조했다. 그런데 API 가격표를 보면 입력과 출력 단가는 각각 20% 내려갔다. 두 숫자가 다른 이유는 무엇일까?
단가는 토큰 한 단위의 가격이고, 작업 비용은 일을 끝낼 때까지 쓴 양까지 반영하기 때문이다. 이번 출시를 이해하려면 성능 순위보다 먼저 이 둘을 나눠볼 필요가 있다. Anthropic 공식 발표
가격표에서 확정할 수 있는 것
아래는 2026년 9월 24일 확인한 표준 Claude API 가격이다. 단위는 100만 토큰당 미국 달러이며, Claude 앱의 월 구독료가 아니다.
| 과금 항목 | Opus 5 | Opus 5.5 | 단가 변화 |
|---|---|---|---|
| 일반 입력 | $5 | $4 | 20% 감소 |
| 출력 | $25 | $20 | 20% 감소 |
| 캐시 읽기 | $0.50 | $0.20 | 60% 감소 |
| 5분 캐시 쓰기 | $6.25 | $5 | 20% 감소 |
캐시는 쓰기와 읽기의 가격이 다르므로 일반 입력과 한 항목으로 합치면 안 된다. 실제 청구에는 사용 기능과 플랫폼별 조건도 영향을 줄 수 있다. 공식 API 가격표
여기서 명확한 답 하나가 나온다. 입력·출력 토큰을 이전과 똑같이 사용하고 다른 조건도 같다면, 일반 토큰 비용은 40%가 아니라 20% 줄어든다.
그러면 발표의 40%는 어디에서 나온 걸까? Anthropic은 단가 인하에 더해 작업당 토큰 사용량도 줄어든 결과라고 설명한다. 이것은 회사가 제시한 효율 개선 주장이지, 모든 사용자의 다음 달 청구서가 정확히 40% 줄어든다는 약속은 아니다.
같은 일을 맡겼을 때의 청구서를 계산해보자
한 코딩 작업에서 일반 입력 100만 토큰과 출력 10만 토큰을 사용했다고 가정하자. 한 번의 요청이 아니라 여러 요청을 합친 사용량이어도 계산은 같다. 아래 수치는 설명을 위한 가정이며, 직접 측정한 벤치마크가 아니다. 캐시·도구 요금·별도 할인은 제외했다.
Opus 5에서는 입력 $5와 출력 $2.50을 더해 $7.50이다.
Opus 5.5가 같은 토큰 수로 끝내면 입력 $4와 출력 $2를 더해 $6이다. 차이는 $1.50, 즉 20%다.
이번에는 새 모델이 같은 품질의 결과를 내면서 입력과 출력을 각각 25% 적게 쓴다고 가정해보자. 입력은 75만 토큰, 출력은 7만 5천 토큰이다. 비용은 $3 + $1.50 = $4.50이 된다. 이전 $7.50보다 40% 줄었다.
이 가정이 실제 출시 평가의 세부 조건이라는 뜻은 아니다. 단가 20% 인하와 총비용 40% 감소가 어떻게 동시에 성립할 수 있는지 보여주는 계산이다.
반대 방향도 가능하다. 새 모델로 더 큰 작업을 맡기거나 재시도가 늘어나 사용량이 커지면, 단가가 내려가도 총액은 올라갈 수 있다. 가격표만 보고 월 예산을 그대로 20% 또는 40% 깎아 잡으면 위험한 이유다.
코딩 에이전트에서는 ‘끝냈다’의 기준이 중요하다
Anthropic은 Opus 5.5를 장시간 코딩과 지식 작업에 적합한 모델로 소개했다. 공개한 내부 HAProxy 변환 실험에서는 Fable 5.1보다 짧은 시간과 낮은 비용으로 작업을 끝냈다고 보고했다. 다만 두 결과 모두 원래 회귀 테스트의 거의 전부를 통과했다는 설명이지, 모든 테스트 통과나 운영 환경의 완전한 동등성을 보장한 것은 아니다. 실험 설명
개발팀이 여기서 가져올 질문은 “어느 모델이 항상 이기는가?”보다 “우리 팀은 완료를 무엇으로 인정하는가?”에 가깝다.
예를 들어 코드 생성이 끝나는 시점을 완료로 잡으면, 테스트가 깨진 변경도 저렴한 성공처럼 보인다. 리뷰에서 수정 요청을 받고 다시 실행한 비용까지 포함하면 순위가 달라질 수 있다. 반대로 첫 실행의 비용이 조금 높아도 바로 병합 가능한 결과가 나온다면 총비용은 더 낮을 수 있다.
그래서 모델 교체를 검토한다면, 최근에 사람이 끝낸 작업을 다시 맡겨보는 편이 낫다. 작은 버그 수정, 여러 파일을 건드리는 변경, 원인 탐색이 필요한 문제처럼 실제 업무에서 가져온 작업이면 된다. 같은 시작 코드와 도구 권한을 주고 결과를 평가해야 한다.
이때 API 비용 옆에 사람이 수정한 시간도 따로 적어두자. 둘을 성급히 하나의 금액으로 환산할 필요는 없다. 모델 비용은 내려갔는데 리뷰 부담이 늘었다면, 적어도 그 사실을 놓치지 않을 수 있다.
그리고 실패한 실행을 계산에서 빼면 안 된다. 성공한 작업 한 건의 비용을 보려면 실패와 재시도에 쓴 금액도 포함해야 한다. 결과가 나온 실행만 골라 평균을 내면 실제 운영 예산보다 낙관적인 숫자가 된다.
지금 바꿀 만한가?
Opus 5를 많이 쓰는 팀이라면 Opus 5.5를 비교 평가할 이유는 분명하다. 표준 입력·출력 단가가 내려갔고, 캐시 읽기 가격도 달라졌다. 모델 식별자는 claude-opus-5-5다. 다만 출시 소식만으로 기존 트래픽을 전부 옮길 근거가 생기는 것은 아니다. 공식 출시 안내
이미 저렴한 모델로 충분히 처리하는 업무라면 판단은 또 다르다. 이번 인하의 비교 대상은 Opus 5다. ‘Opus가 싸졌다’와 ‘우리 서비스에서 가장 경제적인 선택이 됐다’는 같은 말이 아니다.
이번 발표를 읽고 가격표에 메모를 하나 남긴다면 이렇게 적겠다.
단가 인하는 확인됐다. 작업당 절감률은 우리 업무에서 측정할 차례다.
그 측정에서 필요한 답은 단순하다. 같은 수준으로 일을 끝냈는가, 전체 사용량이 얼마나 달라졌는가, 사람이 뒤처리하는 시간은 줄었는가. 이 세 가지가 함께 좋아졌다면 모델 교체의 이유를 설명하기 훨씬 쉬워진다.
