Claude Opus 5 Benchmark'ları: Sayılar Gerçekte Ne Söylüyor?
Anthropic, Claude Opus 5 için kendi Fable 5 ve Opus 4.8 modelleriyle ve OpenAI'ın GPT-5.6 Sol'üyle karşılaştırmalı benchmark sayılarını yayımladı. Biz her gün üretimde AI ajanları işleten bir ekibiz — kendi operasyonumuz dahil — bu yüzden bu tabloları lansman manşetinden farklı okuyoruz: "kim kazandı" değil, hangi yetenekler kımıldadı ve bu, sahada AI kuran ekipler için neyi değiştiriyor. Önce tam tablo, sonra okuma.
Sayılar (Anthropic'in yayımladığı haliyle)
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Ajanla terminal kodlama (Frontier-Bench v0.1) | %43,3 | %33,7 | %21,1 | %34,4 |
| Bilgi işi (GDPval-AA v2, Elo) | 1861 | 1747 | 1593 | 1736 |
| Yeni problem çözme (ARC-AGI-3) | %30,2 | — | %1,5 | %7,8 |
| Ajanla arama (BrowseComp) | %90,8 | %87,4 | %84,3 | %90,4 |
| Humanity's Last Exam — araçsız | %56,3 | %56,5 | %49,8 | — |
| Humanity's Last Exam — araçlı | %64,7 | %63,9 | %57,9 | — |
| Bilgisayar kullanımı (OSWorld 2.0) | %70,6 | %66,1 | %55,7 | %62,6 |
| Ajanla kodlama (DeepSWE v1.1) | %68,8 | %69,7 | %59,0 | %72,7 |
| Ajanla kodlama (FrontierCode v1.1, Main) | %53,4 | %53,5 | %46,5 | %47,5 |
| İş akışları (AutomationBench) | %26,0 | %17,4 | %17,0 | %18,1 |
| Hukuk (Legal Agent Benchmark, held-out) | %11,7 | %13,3 | %10,4 | %2,5 |
| Sağlık (HealthBench Professional) | %59,8 | %66,0 (Mythos 5) | %57,4 | %60,5 |
| Biyoloji (BioMysteryBench, zor) | %49,4 | %46,5 | %42,4 | — |
| Biyoloji (BioMysteryBench, insan-çözülmüş) | %90,1 | %89,0 (Mythos 5) | %88,5 | — |
Kaynak: Anthropic'in yayımladığı karşılaştırma. Standart uyarı geçerli: bunlar üreticinin, kendi seçtiği benchmark'larda yayımladığı sayılardır — bağımsız değerlendirmeler gelene kadar yön gösterici kabul edin. İsim notu: Fable 5 ve Mythos 5 aynı temel modeli paylaşır; Fable genel erişime açık ve ek güvenlik önlemli varyanttır, Mythos yalnızca onaylı kurumlara sunulur.
Gerçekten önemli üç sayı
- ARC-AGI-3: tek nesilde %1,5 → %30,2. Tablonun aykırı değeri bu. ARC-AGI bilerek ezberlemeye dirençli tasarlanır — gerçekten yeni bulmacaları çözmeyi ölçer. 20 katlık sıçrama (GPT-5.6: %7,8), genellikle benchmark ayarı değil gerçek bir yetenek değişimi sinyalidir. Bağımsız doğrulamada tutarsa, kurumsal tarafın klasik itirazı — "model görmediği problemde dağılıyor" — ciddi güç kaybetti demektir.
- AutomationBench: %26,0 — diğer herkes ~%17-18. İş-akışı otomasyonu, müşterilerimizin AI'ı gerçekte ne için satın aldığına en yakın benchmark: gerçek araçlar üzerinde çok adımlı süreçler. İki okuma birden doğru: Opus 5 net biçimde öne geçti ve mutlak sayı %26. Benchmark seviyesindeki iş akışlarının dörtte üçü hâlâ başarısız. Ajanları "departmanı otomatikleştir" diye değil; dar kapsam, ara kontrol noktaları ve insana eskalasyonla tasarlamamızın nedeni tam olarak bu.
- OSWorld 2.0: %70,6. Bilgisayar kullanımı "demo" bölgesinden (%55,7 bir nesil önce) "gözetimle kullanılabilir"e geçti. API'sı olmayan eski sistemler için ekran-süren ajanlar gerçek bir entegrasyon seçeneği haline geliyor.
Dürüst yıldız işaretleri
- GPT-5.6 Sol, DeepSWE'yi kazanıyor (%72,7'ye %68,8). İki ajanla-kodlama benchmark'ından birinde OpenAI önde — Opus 5 diğerini (FrontierCode) ve terminal kodlamayı açık farkla alırken. Okuma: kodlama liderliği çekişmeli ve benchmark'a bağlı; çok-modelli yönlendirmenin tek-üretici sadakatini dövmesinin nedeni de bu.
- Fable 5 yer yer Opus 5'i yakalıyor, hatta geçiyor — araçsız HLE, FrontierCode, hukuk. (Tipik olarak) daha ucuz orta katman modelin bu kadar yakın olması, faturanız açısından amiral geminin rekorlarından daha önemlidir: çoğu üretim iş yükünün amiral gemiye ihtiyacı yok.
- Hukukta herkes %11-13 bandında — tablonun sessiz uyarısı. Held-out hukuk ajan görevlerinde her model 8 denemenin ~7'sinde başarısız. 2026'da size otonom hukuk ajanı satan, verinin önünde satış yapıyor.
Pratikte ne değişir
Üretimde AI ajanı işleten ekip olarak (kendi AiMon ve ajan katmanımız dahil) operasyonel çıkarımlarımız: (1) Markaya değil, göreve göre yönlendirin. Tablonun kendisi bunun kanıtı — farklı satırları farklı modeller kazanıyor ve orta katman modeller çoğu işte amiral gemiye yeterince yakın; her şeyi amiral gemiye göndermek mühendislik değil, faturalama kararıdır. Yönlendirme mantığı hangi AI ne için rehberimizde. (2) Onların değil, kendi eval'lerinizi koşun. Üretici benchmark'ı yeni bir modelin var olduğunu söyler; geçmeniz gerektiğini yalnızca kendi prompt'larınız üzerindeki regresyon setiniz söyler. Eval seti olmayan ekip, modeli basın bülteniyle seçiyordur. (3) Yetenek, operasyonun önünde koşuyor. %30'luk ARC skoru ile güvenilir üretim sistemi arasındaki mesafe izleme, guardrail, maliyet kontrolü ve yedek yollardır — AI projelerinin gerçekte yaşadığı ya da öldüğü gösterişsiz katman. O katman bizim günlük işimiz; model katmanının iyileşmesi, taşıyabileceği yükü artırır. Kurumsal tarafta bu modelleri kendi AWS hesabınızda kullanmanın yolu için Bedrock rehberimize bakın.
Sık sorulan sorular
Opus 5, GPT-5.6'dan iyi mi?
Anthropic'in yayımladığı tabloda Opus 5 çoğu satırı önde götürüyor — yeni problem çözme, bilgisayar kullanımı ve iş akışlarında açık farkla — GPT-5.6 Sol ise bir ajanla-kodlama benchmark'ını (DeepSWE) kazanıyor. Çekişmeli, benchmark'a bağlı ve kendi iş yükünüzde doğrulamaya değer.
Fable 5 ile Mythos 5 arasındaki fark ne?
Aynı temel modeli paylaşırlar. Fable 5 genel erişime açıktır ve çift-kullanımlı yetenekler için ek güvenlik önlemleri içerir; Mythos 5 bu önlemler olmadan yalnızca onaylı kurumlara sunulur.
ARC-AGI-3 sonucu neden önemli?
ARC-AGI ezberlemeye dirençli tasarlanır ve gerçekten yeni problem çözmeyi ölçer. Tek nesilde %1,5'ten %30,2'ye çıkmak — GPT-5.6'nın %7,8'ine karşı — benchmark ayarından çok gerçek bir yetenek sıçramasına işaret eder; bağımsız doğrulama bekleniyor.
Üretimde modeli hemen değiştirmeli miyiz?
Basın bülteniyle değil. Kendi eval setinizi kendi prompt ve araçlarınızda koşun, token başına değil tamamlanan iş başına maliyeti karşılaştırın ve önce orta katmana bakın — yayımlanan sayılar orta katman modelleri birçok işte amiral gemilere yakın gösteriyor.
Özet
Opus 5 tablosu gerçek bir hareket gösteriyor — en çok yeni problem çözme ve iş-akışı otomasyonunda — dürüst yıldız işaretleriyle birlikte: çekişmeli bir kodlama tahtı, amiral gemisinin topuğuna basan orta katman modeller ve 8 görevin 7'sinde hâlâ çuvallayan hukuk ajanları. Modeller kendi işlerinde iyileşmeye devam ediyor; sizin işinizde iyileşip iyileşmeyeceklerine ise eval'ler, yönlendirme ve etraflarındaki operasyon katmanı karar veriyor.
Üretimde AI iş yükü mü işletiyorsunuz — ya da planlıyor musunuz? Kendi AI ajanlarımızı her gün üretimde çalıştırıyoruz; müşterilerimiz için Bedrock ve LLM operasyonunu AWS Yönetilen Hizmetler kapsamında üstleniyoruz: model yönlendirme, maliyet kontrolü, eval'ler ve işi dürüst tutan izleme katmanı. Bir görüşmeyle başlayalım.