Anthropic, yeni yapay zeka modeli Fable 5'in koruma mekanizmalarına yönelik eleştirilere yanıt veriyor. Şirket, tartışmalı ve gizli güvenlik önlemlerini gelecekte görünür kılmak istiyor ve şimdiye kadar uygulandıkları için açıkça özür diliyor. Spesifik olarak bunlar, sözde damıtma, yani rakip yapay zeka sistemlerini eğitmek için güçlü bir dil modelinin çıktısını kullanma girişimine karşı koruma mekanizmalarıdır.
Duyurudan sonra devamını okuyun
Tartışma, modelin damıtma taleplerine gizlice yanıt verdiği Fable 5'in koruyucu davranışı nedeniyle alevlendi. Antropik başlangıçta arka planda bu tür model geliştirme girişimlerini tespit edebilecek ve yanıtları özellikle değiştirebilecek veya kötüleştirebilecek görünmez bir mekanizma öngörmüştü. Kullanıcılar bunların hiçbirini fark etmemelidir. Araştırmacılar ve geliştiriciler bu kavramı şeffaf olmadığı gerekçesiyle eleştirdiler ve bu tür gizli müdahalelerin aynı zamanda modele ilişkin bilimsel testleri ve çalışmaları da çarpıttığı konusunda uyardılar.
Fable 5 gelecekte gözle görülür şekilde Opus 4.8'e geri dönecek
Anthropic şimdi X ile ilgili bir gönderide rota düzeltmesini duyuruyor. Şirket, ileriye dönük olarak belirlenen damıtma taleplerini gözle görülür şekilde yönetecek. Fable 5, cevapları gizlice değiştirmek yerine, bu durumlarda tıpkı siber güvenlik ve biyoloji önlemlerinde olduğu gibi eski Claude Opus 4.8 modeline geri dönüyor. Kullanıcılar her seferinde ilgili bir uyarı görmelidir.
Anthropic, API müşterileri için ayrıca reddedilme nedenini açıkça belirtmek istiyor. Önümüzdeki birkaç gün içinde API istekleri için sunucu tarafında bir geri dönüş yapılması bekleniyor. Bu, gelecekte cevabın Fable 5'ten mi yoksa geri dönüş modelinden mi geleceğini görmemizi sağlayacak.
Antropik yanlış dengeyi kabul ediyor
Şirket orijinal yaklaşımın yanlış olduğunu kabul ediyor. Görünür koruma mekanizmalarının özel olarak analiz edilmesi ve atlanması daha kolaydır, bu nedenle bunların güvenliğinin sağlanması daha uzun sürer. Öte yandan gizlilik koruma önlemleri, belirli senaryolara daha yakından uyarlanabilir ve daha az yanlış alarma neden olabilir. Bu nedenle başlangıçta Fable 5'i hızlı ve güvenli bir şekilde sunmak için gizli bir yaklaşım benimsemeye karar verdiler.
Ayrıca okuyun
Anthropic, geriye dönüp baktığımızda bunun yanlış bir karar olduğunu yazıyor. Kullanıcılar hangi koruma önlemlerinin aktif olduğunu ve nedenini anlayabilmelidir. Şirket bunun için açıkça özür diler.
Duyurudan sonra devamını okuyun
Daha fazla şeffaflık, başlangıçta daha fazla yanlış alarm
Ancak bu değişikliğin yan etkileri de var. Sistemleri jailbreak'lerden korumak için temel sınıflandırıcıların başlangıçta daha ihtiyatlı bir şekilde çalışması gerekir. Bu geçici olarak daha fazla yanlış sınıflandırmaya yol açar.
Bu tür yanlış pozitifler, modelin zararsız istekleri hatalı bir şekilde riskli olarak sınıflandırması durumunda ortaya çıkar. Önceki eleştirilerin çoğu tam olarak buradan geliyor.
Güvenlik camiasından eleştiri
Duyuru, güvenlik araştırmacılarının Fable 5'e yönelik şiddetli eleştirilerinden birkaç gün sonra geldi. Birçok uzman, modelin siber güvenlik engellerinin yalnızca hassas talepleri değil aynı zamanda yazılım geliştirme ve BT güvenliğindeki günlük görevleri de kapsadığından şikayetçi. Diğer şeylerin yanı sıra, kod incelemesi, güvenli kod yazma, güvenlik açığı analizi, olay müdahalesi veya yalnızca güvenlikle ilgili uzman makalelerini okumaktan bahsedildi.
Fable 5, Anthropic'in yeni amiral gemisi modeli Mythos 5'in halka açık versiyonudur. İkincisi, siber güvenlik, biyoloji, kimya ve damıtma için herhangi bir yukarı yönlü koruma mekanizmasıyla birlikte gelmez.
Antropik bilgisayar ve biyolojik filtreleri yeniden kullanıyor
Anthropic, açıklamasında siber ve biyolojik güvenlik önlemlerinde de değişiklik sözü verdi. Şu anda sınıflandırıcılarını zararsız sorgulara daha az yanıt verecek şekilde ayarlıyoruz. Yanlış sınıflandırmadan şüphelenen kullanıcılar, bunu Claude Code ve Claude.ai'deki geri bildirim işlevlerinin yanı sıra API istekleri için bir itiraz formu aracılığıyla bildirmelidir.
Düzenlemelerin yeterli olup olmayacağı henüz bilinmiyor. Antropik koruma önlemlerine açıkça bağlı kalıyor ancak eleştirmenler bunları sorgulamadı.
(fo)

Bir yanıt yazın