Anthropic이 2026년 7월 24일 Claude Opus 5를 공개했다. 이름만 보면 단순한 버전 업처럼 보이지만, 이번 발표의 핵심은 “가장 비싼 최상위 모델만 강한 시대”에서 “일상 업무에 투입 가능한 고성능 에이전트 모델”로 무게중심이 옮겨가고 있다는 점이다.
Opus 5는 Claude Fable 5만큼 절대 최상위 장기 자율 작업을 겨냥한 모델은 아니다. 대신 코딩, 지식 업무, 문서 작업, 검색, 컴퓨터 사용, 장기 도구 사용 같은 실무형 작업에서 Fable 5에 가까운 성능을 더 낮은 비용으로 제공하는 모델로 포지셔닝됐다. Anthropic은 Opus 5가 Claude Opus 4.8보다 큰 폭으로 개선됐고, Fable 5의 절반 가격으로 frontier급 지능을 제공한다고 설명한다.
이번 글에서는 Opus 5 발표에서 봐야 할 지점을 정리한다. 단순히 벤치마크 점수만 나열하기보다는, 왜 Opus 5가 개발자와 기업 사용자에게 중요한지, 어떤 작업에 맞는지, 그리고 숫자를 해석할 때 어디까지 조심해야 하는지를 함께 보자.

한 줄 요약
Claude Opus 5는 “매일 쓰는 고성능 에이전트 모델”에 가깝다. Fable 5가 가장 복잡하고 긴 자율 작업을 위한 최상위 모델이라면, Opus 5는 코딩, 지식 업무, 문서 분석, 장기 컨텍스트 작업, 자동화 업무를 더 현실적인 비용으로 처리하기 위한 모델이다.
특히 눈에 띄는 변화는 세 가지다.
- 1M 토큰 컨텍스트와 128k 최대 출력 토큰을 제공한다.
- 생각하기, 즉 thinking이 기본 활성화되어 있고 effort 설정으로 추론 깊이를 조절한다.
- 가격은 Opus 4.8과 같은 100만 입력 토큰당 5달러, 100만 출력 토큰당 25달러다.
이 조합은 꽤 중요하다. 모델이 강해졌는데 가격이 같은 경우, 사용자는 단순히 “더 똑똑한 모델”을 얻는 것이 아니라 같은 예산으로 더 긴 작업, 더 복잡한 도구 사용, 더 많은 자체 검증 루프를 돌릴 수 있게 된다.
Opus 5가 노리는 위치
Anthropic의 현재 Claude 라인업을 보면 모델의 역할이 더 선명해진다. Claude Platform 문서는 복잡한 에이전트 코딩과 기업 업무를 시작할 때 Opus 5를 권하고, 사용 가능한 최고 성능이 필요하면 Fable 5를 선택하라고 설명한다.
| 모델 | 포지션 | API 모델 ID | 가격 |
| Claude Fable 5 | 가장 높은 장기 자율 작업 성능 | claude-fable-5 | 입력 10달러 / 출력 50달러 |
| Claude Opus 5 | 복잡한 에이전트 코딩과 기업 업무 | claude-opus-5 | 입력 5달러 / 출력 25달러 |
| Claude Sonnet 5 | 속도와 지능의 균형 | claude-sonnet-5 | 입력 3달러 / 출력 15달러 |
| Claude Haiku 4.5 | 빠른 처리와 저비용 | claude-haiku-4-5 | 입력 1달러 / 출력 5달러 |
여기서 재미있는 지점은 Opus 5가 “가장 비싼 모델”이 아니라는 점이다. 과거에는 가장 좋은 결과를 얻으려면 무조건 최상위 모델을 골라야 했다. 하지만 Opus 5는 실무자가 매일 부딪히는 복잡한 작업을 Fable 5보다 낮은 비용으로 처리하도록 설계됐다.
즉, Opus 5의 의미는 “최고 점수 모델이 나왔다”보다 “고성능 모델을 업무 기본값으로 둘 수 있는 가격대가 내려왔다”에 가깝다.
벤치마크 표에서 봐야 할 것
사용자가 공유한 벤치마크 표와 Anthropic 공식 발표의 비교표를 보면 Opus 5가 여러 영역에서 Opus 4.8을 크게 앞선다. 특히 agentic terminal coding, knowledge work, ARC-AGI-3, OSWorld 2.0, AutomationBench 같은 항목이 눈에 띈다.

그림: Claude Opus 5와 Fable 5, Opus 4.8, GPT-5.6 Sol의 주요 벤치마크 비교. 출처: Anthropic 공식 발표
표를 해석할 때는 “몇 개를 이겼다”보다 “어떤 종류의 작업에서 강해졌는가”를 보는 편이 낫다.
첫째, Opus 5는 agentic terminal coding에서 43.3%를 기록했다. 같은 표에서 Fable 5는 33.7%, Opus 4.8은 21.1%, GPT-5.6 Sol은 34.4%로 제시되어 있다. 터미널 기반 코딩 벤치마크는 단순 코딩 문제가 아니라 도구를 쓰고, 실패를 관찰하고, 다시 시도하는 능력을 본다. 이 영역에서 점수가 오른다는 것은 “한 번에 답을 맞히는 모델”보다 “작업을 끝까지 몰고 가는 모델”에 가까워졌다는 뜻이다.
둘째, knowledge work에서는 GDPval-AA v2 기준 1861로 제시됐다. GDPval은 경제적으로 가치 있는 실제 업무에 가까운 작업을 평가하려는 흐름의 벤치마크다. 숫자 자체보다 중요한 것은 모델 평가가 점점 수학 문제, 코딩 문제에서 벗어나 보고서, 문서, 업무 판단, 분석 산출물 같은 영역으로 확장되고 있다는 점이다.
셋째, ARC-AGI-3에서는 30.2%가 제시됐다. ARC Prize의 별도 결과 페이지도 2026년 7월 24일 기준 Claude Opus 5가 ARC-AGI-3에서 30.2% 수준의 최고 점수를 냈다고 설명한다. ARC-AGI류 평가는 훈련 데이터에서 외운 지식을 꺼내는 능력보다 낯선 문제를 일반화해서 푸는 능력을 보려는 성격이 강하다.
넷째, OSWorld 2.0에서는 70.6%가 제시됐다. OSWorld는 실제 데스크톱 환경에서 긴 작업 흐름을 수행하는 컴퓨터 사용 에이전트 평가다. 앞으로 에이전트가 브라우저, 터미널, 문서 편집기, 사내 도구를 오가며 일하게 될수록 이런 평가는 더 중요해질 가능성이 크다.
다만 이 표는 공급자 발표 자료라는 점도 잊으면 안 된다. 벤치마크는 조건, 하네스, 시도 횟수, 도구 제공 방식, 추론 effort, 비용 계산 방식에 따라 달라진다. 따라서 실무적으로는 “Opus 5가 특정 공개 표에서 앞섰다”보다 “우리 업무의 실패 유형에서 실제로 덜 실패하는가”를 별도로 검증해야 한다.
Opus 5에서 가장 실무적인 변화: thinking 기본 활성화
Claude Platform 문서에서 가장 중요한 변경점은 thinking이 기본 활성화됐다는 점이다. Opus 4.8에서는 명시적으로 thinking: {"type": "adaptive"}를 설정하지 않으면 thinking 없이 실행됐다. Opus 5에서는 같은 요청도 기본적으로 thinking이 켜진 상태로 실행된다.
이 변화는 개발자에게 꽤 실질적인 영향을 준다.
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)
이 예시에서 핵심은 output_config={"effort": "max"}다. Opus 5는 low, medium, high, xhigh, max effort 단계를 제공하고, 기본값은 high다. 복잡한 작업에서는 effort를 높여 더 깊게 추론하게 만들 수 있고, 단순 작업에서는 낮춰 비용과 지연 시간을 줄일 수 있다.
단, max_tokens 해석도 조심해야 한다. 문서에 따르면 max_tokens는 생각 과정과 최종 응답을 합친 전체 출력 한도다. 기존에 Opus 4.8을 thinking 없이 쓰던 워크로드를 그대로 옮기면, Opus 5에서는 thinking이 토큰 예산을 일부 사용하므로 출력 한도를 다시 잡아야 할 수 있다.
또 하나의 breaking change도 있다. Opus 5에서 thinking을 비활성화하려면 effort가 high 이하이어야 한다. xhigh나 max effort에서 thinking: {"type": "disabled"}를 설정하면 400 오류가 발생한다. 마이그레이션할 때 놓치기 쉬운 지점이다.
1M 컨텍스트와 128k 출력이 의미하는 것
Opus 5는 1M 토큰 컨텍스트 윈도우를 기본값이자 최대값으로 제공한다. 출력은 synchronous Messages API 기준 최대 128k 토큰이다. 이 정도면 단순히 “긴 문서를 많이 넣을 수 있다”를 넘어선다.
실무에서는 다음과 같은 작업이 가능해진다.
- 대규모 코드베이스의 여러 파일을 함께 읽고 리팩터링 방향을 잡는다.
- 긴 정책 문서, 계약서, 보안 기준서, 운영 매뉴얼을 한 번에 비교한다.
- 에이전트가 작업 중 생성한 로그, 테스트 결과, 오류 메시지를 누적해서 맥락을 잃지 않게 한다.
- 문서 초안, 표, 슬라이드, 코드 변경안을 한 세션에서 여러 차례 수정한다.
다만 긴 컨텍스트는 공짜가 아니다. 많이 넣으면 비용도 올라가고, 불필요한 맥락이 많아질수록 모델이 중요한 신호를 놓칠 수도 있다. 그래서 Opus 5의 1M 컨텍스트는 “무조건 다 넣자”가 아니라 “정말 긴 작업을 끊지 않고 유지할 수 있는 선택지”로 보는 게 맞다.
코딩 모델이 아니라 에이전트 모델에 가깝다
Opus 5 발표에서 반복되는 단어는 coding보다 agentic이다. Anthropic은 Opus 5가 도구 사용 루프를 오래 유지하고, 멀티 파일 기능 구현, 큰 리팩터링, 엔드투엔드 기능 작업을 placeholder 없이 마무리하는 데 강하다고 설명한다.
이건 일반적인 코드 생성 능력과 다르다. 코드 생성은 “이 함수를 만들어줘”에 가깝다. 에이전트 코딩은 “이 저장소에서 버그를 찾아 고치고 테스트하고, 깨진 부분을 다시 확인한 뒤, 변경 이유까지 정리해줘”에 가깝다.
실제 개발 업무에서 중요한 건 첫 답변의 화려함이 아니다. 중간에 실패했을 때 로그를 읽고, 가설을 바꾸고, 테스트를 다시 돌리고, 원인과 증상을 구분하는 능력이다. Opus 5가 강조하는 “self-verification”과 “long-horizon task”는 바로 이 부분과 연결된다.
블로그를 운영하거나 강의 자료를 만들거나 클라우드 보안 실습을 구성하는 입장에서도 의미가 있다. 한 번의 프롬프트로 끝나는 글쓰기보다, 자료 조사, 초안 작성, 코드 검증, 표 정리, 이미지 배치, 업로드 검증처럼 여러 단계가 이어지는 작업에서 모델의 실력이 드러나기 때문이다.
자동 fallback과 중간 도구 변경
Opus 5와 함께 Claude Platform에는 두 가지 베타 기능도 발표됐다.
첫째는 mid-conversation tool changes다. 대화 중간에 사용할 도구 목록을 바꿀 수 있고, 이때 prompt cache를 유지할 수 있다. 기존에는 세션 시작 시 고정된 도구 목록을 계속 보내는 방식이 일반적이었다. 그런데 실제 에이전트 업무에서는 처음에는 검색 도구가 필요하고, 중간에는 코드 실행 도구가 필요하고, 마지막에는 문서 작성 도구만 필요할 수 있다. 도구를 유연하게 바꾸면서 캐시를 보존할 수 있다면 긴 작업의 비용과 설계가 달라진다.
둘째는 default fallbacks mode다. 안전 분류기나 거절 상황에 따라 사용자가 직접 fallback 모델 목록을 관리하는 대신, Anthropic의 추천 fallback을 적용할 수 있다. 특히 Opus 5나 Fable 5에서 특정 요청이 안전 정책에 걸릴 때, 무조건 차단으로 끝내지 않고 적절한 모델로 넘기는 흐름을 만들 수 있다.
다만 이 기능들은 베타 헤더를 써야 한다. 즉, 당장 모든 프로덕션 시스템에서 아무 생각 없이 켜는 기능이라기보다는, 에이전트 플랫폼을 직접 만들거나 비용 최적화를 세밀하게 하고 싶은 팀이 실험해볼 기능에 가깝다.
안전성: 강해졌지만 일부 영역은 더 조심스럽다
Opus 5 발표에서 흥미로운 부분은 성능만큼 안전성 이야기가 크다는 점이다. Anthropic은 Opus 5가 자사 자동 행동 감사에서 최근 모델 중 가장 낮은 misaligned behavior 점수를 보였고, misuse에 속을 가능성이 낮다고 설명한다.
동시에 Opus 5가 위험한 dual-use capability의 frontier를 더 밀어 올리지는 않는다고 말한다. 특히 offensive cybersecurity와 생물학 장기 자율 연구에서는 Mythos 5가 더 강하다고 설명한다. 보안 관점에서 중요한 문장은 “소스코드 취약점 찾기는 허용하지만, binary-based vulnerability scanning, penetration testing, exploit generation 같은 영역은 차단한다”는 부분이다.
이건 보안 업무를 하는 사람에게 약간 미묘하다. 정적 코드 리뷰, 취약점 패턴 설명, 방어적 분석에는 Opus 5가 유용할 수 있다. 하지만 침투 테스트 자동화나 exploit 작성처럼 악용 가능성이 높은 흐름에서는 safeguard가 개입할 가능성이 있다.
또 Anthropic은 Fable 5보다 Opus 5의 사이버 분류기가 덜 제한적이며, Opus 5에서 플래그된 요청은 Claude.ai, Claude Code, Claude Cowork에서 기본적으로 Opus 4.8로 fallback된다고 설명한다. 즉, Opus 5는 “보안 업무를 못 하는 모델”이라기보다 “방어적 업무는 더 열어두되 위험한 실행 단계는 더 조심스럽게 막는 모델”에 가깝다.
개발자가 바로 확인해야 할 마이그레이션 포인트
Opus 4.8에서 Opus 5로 넘어갈 때 가장 단순한 변경은 모델 ID다.
model = "claude-opus-4-8" # before
model = "claude-opus-5" # after
하지만 실제로는 아래를 같이 확인해야 한다.
| 확인 항목 | 왜 중요한가 |
| max_tokens | thinking이 기본 활성화되면서 생각 과정과 응답이 같은 출력 예산을 공유한다. |
| output_config.effort | 비용, 지연 시간, 품질의 균형을 직접 조절하는 핵심 파라미터다. |
| thinking 비활성화 조건 | xhigh, max effort에서는 thinking disabled가 400 오류를 낸다. |
| prompt cache 최소 길이 | Opus 5는 cacheable prompt 최소 길이가 512 토큰으로 낮아졌다. |
| fallback 설계 | 안전 분류기 거절 시 다른 모델로 넘길지, 사용자에게 중단을 알릴지 결정해야 한다. |
| 평가 기준 | 공급자 벤치마크만 보지 말고 내부 업무 샘플로 회귀 테스트를 해야 한다. |
특히 사내 에이전트나 자동화 시스템에 연결해 쓰고 있다면, 모델만 바꾸고 끝내면 안 된다. 같은 프롬프트가 더 길게 답하거나, 스스로 검증 단계를 더 많이 수행하거나, 도구 사용 방식이 달라질 수 있다. 좋은 변화일 수도 있지만, 이미 세밀하게 맞춰둔 워크플로에서는 예상하지 못한 비용 증가나 단계 중복이 생길 수 있다.
어떤 팀이 Opus 5를 먼저 써볼 만한가
Opus 5는 다음과 같은 팀에 특히 잘 맞아 보인다.
개발팀이라면 복잡한 버그 분석, 코드 리뷰, 멀티 파일 리팩터링, 테스트 보강, 오래된 코드베이스 이해에 써볼 만하다. 단순 코드 스니펫 생성은 더 저렴한 모델로도 충분할 수 있지만, 저장소 전체 맥락을 따라가며 스스로 검증해야 하는 작업은 Opus 5의 장점이 드러나는 영역이다.
보안팀이라면 정책 문서 분석, 보안 점검표 생성, 코드 취약점 리뷰, 클라우드 설정 검토, 사고 보고서 초안 작성 같은 방어적 업무에 적합하다. 다만 침투 테스트 자동화나 exploit 작성처럼 safeguard가 개입할 수 있는 작업은 별도의 검증과 정책 확인이 필요하다.
데이터·리서치팀이라면 긴 보고서 요약, 여러 문서 비교, 복잡한 표 분석, 실험 결과 해석에 쓸 수 있다. Opus 5가 문서와 스프레드시트 작업, 장기 컨텍스트에서 개선됐다는 점은 이 영역과 잘 맞는다.
운영·업무 자동화팀이라면 Zapier AutomationBench에서 강조된 것처럼 여러 단계를 거쳐 실제 업무를 끝내는 자동화 흐름을 테스트해볼 만하다. 계정 상태를 확인하고, 위험 신호를 분류하고, 알림을 보내고, 요약 보고서를 만드는 식의 업무가 대표적이다.
그래도 벤치마크는 벤치마크다
Opus 5 발표는 인상적이지만, 벤치마크 숫자를 그대로 구매 결정으로 바꾸는 건 위험하다. 모델 평가는 점점 복잡해지고 있다. 같은 모델이라도 effort 설정, 도구 제공 방식, 시도 횟수, 비용 예산, fallback 유무, 안전 필터 개입 여부에 따라 결과가 바뀐다.
따라서 실무 도입은 작은 내부 평가부터 시작하는 것이 좋다.
- 실제 업무에서 자주 실패하는 샘플 20~50개를 모은다.
- Opus 4.8, Sonnet 5, Opus 5를 같은 조건에서 비교한다.
- 정답률뿐 아니라 비용, 지연 시간, 재시도 횟수, 사람이 수정한 시간을 같이 본다.
- 보안·개인정보·저작권·내부 데이터 정책에 맞는 사용 범위를 정한다.
- 좋은 결과가 나온 업무부터 제한적으로 기본 모델을 바꾼다.
AI 모델 선택은 점점 “가장 똑똑한 모델 하나 고르기”가 아니라 “업무별로 effort와 모델을 조합하기”에 가까워지고 있다. Opus 5는 이 흐름을 꽤 잘 보여주는 모델이다.
결론: Opus 5의 진짜 메시지
Claude Opus 5의 진짜 메시지는 “또 하나의 프론티어 모델 출시”가 아니다. 더 정확히는 고성능 에이전트 모델의 가격대가 내려오고, 모델 사용 방식이 단발성 질의응답에서 장기 업무 수행으로 이동하고 있다는 신호다.
Fable 5는 여전히 가장 복잡한 장기 자율 작업을 위한 최상위 선택지로 남아 있다. 하지만 매일 반복되는 개발, 문서, 분석, 자동화, 보안 검토 업무에서는 Opus 5가 더 현실적인 기본값이 될 수 있다. 같은 Opus 4.8 가격에 더 긴 컨텍스트, 기본 thinking, effort 조절, 강해진 에이전트 성능을 제공하기 때문이다.
다만 좋은 모델일수록 더 좋은 평가 습관이 필요하다. 벤치마크 표는 출발점이고, 최종 판단은 우리 업무에서 덜 틀리고, 덜 헤매고, 더 적은 비용으로 끝까지 일을 마치는지로 내려야 한다. Opus 5는 그 기준에서 충분히 테스트해볼 만한 모델이다.
참고 자료
'일반IT > AI' 카테고리의 다른 글
| Open WebUI만 있는 것은 아니다 — AI 모델을 위한 오픈소스 UI 6가지 비교 (0) | 2026.07.24 |
|---|---|
| AI로 페이스북 마케팅을 한다는 것 — 클씨랩 프로젝트에서 만든 작은 팀의 광고 시스템 (1) | 2026.07.24 |
| LLM은 어떻게 배우고 답하는가 — 대규모 언어 모델의 학습과 추론 과정 (0) | 2026.07.22 |
| 생성형 AI는 갑자기 나타난 기술이 아니다 — AI 역사와 분류로 이해하는 기존 머신러닝과의 차이 (1) | 2026.07.22 |
| Claude Fable급 모델을 Qwen으로 직접 운영하면 AWS 비용은 얼마일까? (1) | 2026.07.22 |