İçeriğe geç
LargeLanguageModel.com.tr
Tüm yazılar

Anthropic, Claude Opus 4.1’i duyurdu: Kodlama doğruluğu yüzde 74,5’e çıktı, güvenli ajansal arama güçlendi

2 dk okuma

Anthropic, en gelişmiş modeli Claude Opus 4.1’i yayınladı. Model, gerçek dünya kodlama görevlerinde doğruluğu SWE-bench Verified’da yüzde 74,5’e yükseltiyor; detay takibi, ajansal arama, derin araştırma ve veri analizi becerilerini belirgin biçimde güçlendiriyor. Opus 4.1; GitHub, Rakuten ve Windsurf gibi kurumsal geri bildirimlerde çok dosyalı refaktoring ve büyük kod tabanlarında nokta atışı düzeltmelerle öne çıkıyor. Model, Claude Code, API, Amazon Bedrock ve Google Cloud Vertex AI üzerinden aynı fiyatla kullanılabiliyor.

Anthropic, Claude ailesinin en üst segmentinde yer alan Claude Opus 4.1’i duyurdu. Şirket, yeni sürümün özellikle gerçek dünya kodlama görevleri, ajansal arama ve gerekçelendirme (reasoning) kabiliyetlerinde anlamlı iyileştirmeler içerdiğini belirtiyor. Opus 4.1, SWE-bench Verified değerlendirmesinde yüzde 74,5 doğruluk elde ederek önceki nesil modellere göre çıtayı yükseltti. Bu sonuç, Claude Sonnet 3.7’nin yüzde 62,3’lük performansına ve Opus 4’ün üzerinde raporlanan değerlere kıyasla kayda değer bir artışı işaret ediyor.


Model; detay takibi, uzun soluklu araştırma ve veri analizi süreçlerinde daha tutarlı sonuçlar üretmek üzere optimize edildi. Ajansal arama tarafında geliştirilen yetenekler, çok adımlı görevlerde daha iyi planlama ve araç kullanımıyla birleşerek yazılım mühendisliği iş akışlarını hızlandırmayı hedefliyor. Anthropic’e göre Opus 4.1, kompleks AI ajanları, ileri seviye kodlama projeleri ve ayrıntı odaklı, uzun ufuklu otonom görevler gibi “doğruluk ve yetenek” gerektiren zorlu kullanım senaryoları için öneriliyor.


Kurumlardan gelen erken geri bildirimler de iyileşmeyi destekliyor: GitHub, Opus 4.1’in çok dosyalı kod refaktoring’inde belirgin ilerleme kaydettiğini; Rakuten Group ise büyük kod tabanlarında gereksiz değişiklik yapmadan, hata eklemeden nokta atışı düzeltmeler üretebildiğini aktarıyor. Geliştirici aracı Windsurf, junior geliştirici benchmark’ında Opus 4’e kıyasla bir standart sapma seviyesinde sıçrama bildirdi; bu da Sonnet 3.7’den Sonnet 4’e geçişte görülen kazanımlara benzer bir adımı işaret ediyor.


Opus 4.1, ücretli Claude kullanıcılarına ve Claude Code içinde sunuluyor; ayrıca Anthropic API’sinde, Amazon Bedrock ve Google Cloud’un Vertex AI platformlarında da erişilebilir. Fiyatlandırma, Opus 4 ile aynı seviyede korunuyor. Geliştiriciler, API üzerinden “claude-opus-4-1-20250805” model kimliğiyle geçiş yapabiliyor. Anthropic, yakın haftalarda daha büyük model iyileştirmeleri yayınlamayı planladığını vurgularken, özellikle SWE-bench ve TAU-bench gibi değerlendirmelerde kullanılan metodolojileri ve “extended thinking” modunun kapsamını şeffaf biçimde paylaşıyor.


Kullanıcı tarafında ise Claude Code aboneliği kullananların, ccusage gibi araçlarla gerçek kullanım ve maliyet takibi yapabildiğine dair topluluk paylaşımları öne çıkıyor. Temel plan kullanıcılarının, bağlam temizliği alışkanlıkları edindikten sonra token sınırlarına daha az takıldığı da ifade ediliyor. Tüm bu gelişmelerle birlikte Opus 4.1, artan popülerlik ve talebin getirdiği ölçeklenme gereksinimlerine güvenlik ve güvenilirlik vurgusunu koruyarak yanıt verme iddiasında.

Paylaş
Yapay Zeka

OpenAI, Apache 2.0 lisanslı GPT-OSS-120B ve 20B açık ağırlıklarını yayımladı: Ücretsiz indirme, yüksek akıl yürütme performansı

OpenAI, altı yıl sonra ilk kez açık ağırlıklı iki büyük dil modelini, GPT-OSS-120B ve GPT-OSS-20B’yi Apache 2.0 lisansı ile ücretsiz indirmeye sundu. MoE mimarisi, 128K bağlam, yüksek akıl yürütme ve araç kullanımı performansı, düşük donanım gereksinimleri ve geniş dağıtım seçenekleriyle modeller; geliştiriciler, kurumlar ve araştırmacılar için dikkat çekici bir alternatif sunuyor. Güvenlik tarafında CBRN filtreleri, denetimsiz CoT izlenebilirliği ve 500 bin dolarlık red teaming yarışması öne çıkıyor.

2 dk
Yapay Zeka

GPT-5: Düşünmeyi Seçen Yapay Zeka — Hızlı, Derin ve Daha Güvenilir.

OpenAI, 7 Ağustos 2025’te GPT-5’i tanıttı: tek bir çatı altında “hızlı” ve “düşünen” modları gerçek zamanlı olarak yöneten bir sistem. GPT-5, kodlama, matematik, yazı, sağlık ve çoklu modal algılamada önceki modellere göre belirgin iyileşmeler sunuyor; bazı benchmark’larda (AIME, SWE-bench, MMMU, HealthBench vb.) üst sıralara yerleşiyor. Ayrıca “GPT-5 thinking” olarak adlandırılan derin muhakeme modu ile uzun, karmaşık ve hataya açık sorgularda daha doğru ve daha dürüst cevaplar üretme yönünde somut kazanımlar bildiriliyor. Model ailesi üç ana varyanta (regular/mini/nano) ayrılmış; yüksek token limitleri ve API’de görünen “reasoning” seçenekleri geliştiricilere yeni kontrol imkânları veriyor. Fiyatlandırma rekabetçi seviyede konumlanmış; token maliyetlerinde düşüşler ve kısa süreli token-cache indirimleri dikkat çekiyor. Ancak prompt-injection ve güvenlik testlerinde hâlâ kayda değer zorluklar olduğu; güvenlik yaklaşımlarının (örn. “safe-completions”) üretkenlik ile güvenlik arasında yeni dengeler aradığı vurgulanıyor.

2 dk