숫자로 확인된 성과

제3자 평가, Anthropic 발표, 파트너 측정을 나눠 정리.

24건
모아보기24건

숫자로 확인된 성과

제3자 평가, Anthropic 발표, 파트너 측정을 나눠 정리.

제3자가 잰 결과와 회사가 스스로 잰 결과를 나눠 적는다. 같은 시험이라도 출처마다 숫자가 다르다. 예를 들어 Terminal-Bench 4.0은 Anthropic 66.4%, Artificial Analysis 59.6%, Vals AI 61.62%다.

독립 평가
평가결과비교와 조건출처
Artificial Analysis 지능 지표58점, 1위GPT-6 Astra·Fable 5.1 53점, Opus 5 51점. max 강도 기준. 작업당 비용은 max 5.98달러로 Opus 5 max(5.86달러)와 비슷AA 분석
ARC-AGI-2 (ARC Prize 검증)93.3%, 문제당 0.41달러Opus 5보다 2.9%p 높고 채점 비용은 약 80% 낮음. ARC-AGI-1은 98.5%, 문제당 0.16달러@arcprize
Vals AI6개 평가에서 1위Terminal-Bench 2.1 87.64%, Terminal-Bench 4.0 61.62%, ProofBench v1.1 100%, MedScribe 91.43% 등vals.ai
METRAI 연구개발 속도 약 1.5배외부 안전성 평가 기관의 추정. "Fable 5.1 대비 소폭 개선"이라고 평가METR 블로그
Next.js 평가 (Vercel)성공률 97%, 공동 1위GPT-6 Sol·Fable 5.1도 97%. 평균 비용은 Opus 5.5가 0.234달러로 셋 중 가장 낮음@nextjs
Anthropic 발표
시험Opus 5.5Opus 5Fable 5.1
Terminal-Bench 4.0 (터미널 작업)66.4%52.3%55.8%
SWE-bench Pro (실제 코드 수정, 시스템 카드)89.9%79.2%81.2%
OSWorld 2.0 (컴퓨터 조작)81.8%74.0%80.7%
GDPval-AA (지식 노동)1,846점1,708점1,735점

230쪽짜리 시스템 카드에는 에이전트 100개 이상이 동시에 24시간 협업하는 장기 과제에서 팀 크기와 관계없이 Opus 5와 Fable 5.1을 앞섰다는 평가도 있다(193~194쪽).

파트너 발표
회사밝힌 결과출처
Cursor자사 코딩 시험 CursorBench 57.8%(Max)로 출시 시점 최고, 작업당 비용 40% 절감@cursor_ai
Cognition (Devin)FrontierCode 1.1 1위, Extended 65.3%. Fable 5 비용의 10분의 1 미만Devin 블로그
Perplexity자체 평가 WANDR 0.610, 작업당 4.13달러. Fable 5.1보다 조금 높고 67.6% 저렴@perplexity_ai
GitHub CopilotOpus 5와 비슷한 해결률을 훨씬 적은 단계와 토큰으로. GitHub CPO는 "절반 이하 단계로 더 많이 해결"GitHub 변경 기록
Lovable기존 코드에서 최대 48% 적은 단계, 품질은 그대로@Lovable
CodeRabbit알려진 버그 80개 중 51개(기존 49개), 어려운 13개 중 10개(기존 5개). 대신 토큰 약 50% 더 쓰고 기존이 잡던 9개는 놓침@coderabbitai
depthfirst보안 시험 dfbench에서 high 강도로 재현율 54.9%, 정밀도 48.5%. 작업당 8.42달러X 원문
Deloitte가장 낮은 강도로도 알려진 버그 72% 검출(Opus 5는 high로 56%)Anthropic 발표 인용
Hebbia금융 업무 전체 흐름 충족률 86.6%(Opus 5는 60.3%)Anthropic 발표 인용
Quantium38번의 요청과 4일 걸리던 코딩 작업이 11번의 요청과 3시간으로Anthropic 발표 인용
Stripe서로 이어진 PR 40개를 최신 코드 위로 다시 올리는 며칠짜리 작업에서 충돌 지점을 명확히 정리했고, 다음 날 오후 40개 모두 자동 테스트 통과Anthropic 발표 인용
Optiver절반의 대화 횟수·시간·출력으로 같은 품질, 해당 작업 비용 40~50% 절감Anthropic 발표 인용
Box토큰은 3분의 1, 답변은 40% 덜 장황, 정확도는 그대로Anthropic 발표 인용
Walleye Capital자사 지시문에서 분 단위 번호가 하나씩 밀려 있는 것을 스스로 찾아 바로잡았고, 그 때문에 채점 점수가 깎일 수 있다고 먼저 알림Anthropic 발표 인용
익명 초기 테스터68만 줄 코드 이전을 하루 안에. 엔지니어 팀이면 몇 주 걸릴 일Anthropic 발표
Artificial Analysis 지능 지표 막대그래프와 작업당 비용 산점도. Claude Opus 5.5(max)가 58점으로 1위, Fable 5.1과 GPT-6 Astra가 53점, Opus 5가 51점
ARC-AGI-2 리더보드 산점도. Opus 5.5 선이 작업당 약 0.4달러에서 93% 안팎으로 Opus 5보다 싸고 높은 자리에 있다
Next.js 평가 표. Opus 5.5(high) 평균 비용 0.234달러 성공률 97%, GPT-6 Sol(high) 0.244달러 97%, Fable 5.1(high) 0.722달러 97%
CursorBench 4.0 점수와 작업당 평균 비용 그래프. Opus 5.5 선이 모든 비용 구간에서 Fable 5.1, Grok 4.7, GPT-5.6 Sol보다 위에 있다