앤트로픽 ‘Claude Opus 5.5’ 공개…가격 40% 낮추고 외부 안전평가 거쳤다
앤트로픽이 Claude 5.5 계열의 첫 모델 ‘Claude Opus 5.5’를 출시했습니다. 회사는 대부분의 작업에서 상위 모델 Claude Fable 5.1에 가까운 성능을 내면서 이전 Opus 5보다 운영비를 40% 낮췄다고 설명했습니다. 입력 100만 토큰당 4달러, 출력 20달러로 책정됐고 AWS Bedrock에도 동시에 공급됩니다. 다만 벤치마크와 안전성 수치는 회사가 고른 평가 조건의 결과이므로 실제 업무 비용과 품질은 독립 검증이 필요합니다.
‘가장 비싼 모델’ 대신 가격 대비 성능을 앞세웠다
앤트로픽이 9월 22일 Claude 5.5 계열의 첫 모델인 ‘Claude Opus 5.5’를 공개했습니다. 회사 설명의 핵심은 최고 점수 하나보다 비용 구조입니다. 대부분의 작업에서 고가 모델 Claude Fable 5.1에 가까운 성능을 내면서, 직전 Opus 5보다 운영 비용을 40% 낮췄다고 밝혔습니다. 고성능 모델을 모든 요청에 쓰기 어려웠던 기업에 품질과 단가 사이의 새 선택지를 제시한 셈입니다.
공식 API 가격은 입력 100만 토큰당 4달러, 출력 20달러입니다. 실제 비용은 긴 컨텍스트, 도구 호출, 재시도와 출력 길이에 따라 달라집니다. ‘40% 절감’은 Opus 5와의 비교이지 모든 경쟁 모델보다 싸다는 뜻은 아닙니다.
코딩·장기 작업을 겨냥한 Opus의 자리
앤트로픽은 Opus 5.5를 대규모 코드베이스 수정, 코드 리뷰와 버그 탐지, 금융·과학 분석, 복잡한 문서와 시각자료 해석에 맞춘 주력 모델로 소개합니다. 적응형 추론을 기본으로 사용하고 작업 난도에 따라 계산량을 조절하는 방식입니다. 한 번의 질문에 짧게 답하는 챗봇보다 여러 파일과 도구를 오가며 긴 작업을 끝내는 에이전트 환경이 주된 경쟁 무대입니다.
로이터는 소프트웨어 개발 평가에서 OpenAI GPT-5.6 Sol보다 앞선 결과가 제시됐다고 보도했습니다. 그러나 벤치마크는 프롬프트, 도구 권한, 시간 제한과 채점 방식에 민감합니다. 공개 표의 순위를 실제 개발 생산성으로 바로 옮기기보다 같은 저장소와 테스트에서 성공률, 수정 정확도, 토큰 비용, 사람이 되돌린 변경의 비율을 함께 재는 것이 필요합니다.
METR·Frontier Design을 출시 전에 불렀다
이번 발표에서 안전 절차도 전면에 놓였습니다. 앤트로픽은 출시 전 METR와 Frontier Design 등 외부 평가기관이 모델을 시험했다고 밝혔습니다. 자체 종합 정렬 평가에서는 지금까지 자사 모델 가운데 가장 높은 점수를 냈고, 이전 Opus 계열보다 통제 회피 성향이 줄었다고 설명했습니다. 이는 성능 경쟁과 함께 외부 평가를 출시 조건으로 묶으려는 시도입니다.
외부 평가를 받았다는 사실과 위험이 사라졌다는 결론은 다릅니다. 제한된 테스트는 실제 사용자가 새 도구를 연결했을 때의 행동까지 모두 재현하지 못합니다. 평가기관의 전체 보고서와 실패 사례, 업데이트 뒤 재시험이 함께 공개돼야 합니다.
AWS Bedrock 공급이 기업 도입을 당긴다
AWS는 같은 날 Claude Opus 5.5를 Amazon Bedrock에 추가했습니다. 개발자는 전 세계용 모델 ID를 지정해 기존 Bedrock 권한관리와 로깅, 네트워크 통제 안에서 모델을 호출할 수 있습니다. 기업 입장에서는 별도 계정과 데이터 경로를 새로 만들지 않고 기존 클라우드 정책 안에서 평가를 시작할 수 있다는 점이 중요합니다.
동시 공급은 배포 속도를 높이지만 종속성도 늘립니다. Bedrock 사용료와 데이터 전송, 도구 실행 비용까지 계산해야 합니다. 특정 모델에 맞춘 워크플로의 교체 비용을 줄이려면 도입 단계부터 회귀 테스트와 대체 경로가 필요합니다.
발표 수치보다 실제 작업비용
Opus 5.5의 의미는 최고급 모델의 성능 일부를 더 낮은 단가로 끌어내렸다는 데 있습니다. 대량의 코드 검토나 문서 분석처럼 출력이 길고 반복 호출이 많은 업무에서는 토큰 단가 차이가 빠르게 누적됩니다. 반대로 단순 요약과 분류라면 더 작은 모델이 여전히 경제적일 수 있어 ‘최신 모델로 전환’ 자체가 최적화는 아닙니다.
검증 항목은 명확합니다. 동일 업무에서 끝까지 완료한 비율, 사람이 수정한 횟수, 입력·출력·도구 호출을 합친 건당 비용, 민감정보 처리와 거부 오류를 함께 측정해야 합니다. 이번 출시는 성능표 한 장보다 고성능 모델의 가격과 안전평가 절차가 제품 경쟁의 핵심으로 이동했다는 신호로 보는 편이 정확합니다.
기사가 마음에 드셨다면 하트를 눌러주세요.
기사 읽고, 잠깐 게임 한 판 어떠세요?

공격을 주고받으며 실시간으로 겨루는 AI 블록 대전
미니게임 고르기 ▶