uzmanlar neden tek başına hareket etmediğini açıklıyor

OpenAIDünyanın en büyük yapay zeka şirketlerinden biri olan , bu hafta iki modelinin test ortamından çıkıp internete erişmeyi başardığını ve Hugging Face sistemlerini hacklemekAI modellerini, uygulamalarını ve veritabanlarını dağıtmak için kullanılan ana platformlardan biri.

Şirket bölümü şu şekilde tanımladı: “benzeri görülmemiş” bir siber güvenlik olayı. Ön yeniden yapılandırmaya göre, GPT 5.6 Sol ve henüz piyasaya sürülmemiş başka bir gelişmiş model, çeşitli güvenlik açıklarından yararlandı, kimlik bilgilerini çaldı ve Hugging Face altyapısı içinde kendileri tarafından kontrol edilen talimatları yürütmenin bir yolunu buldu.

Bu durum, modellerin zaten uzun süreler boyunca karmaşık işlemleri gerçekleştirebildiğini ve kendi yaratıcılarının tahmin etmediği saldırı yollarını bulabildiğini gösteren bir kanıt olarak sunuldu. Aslında Hugging Face günler önce davetsiz misafirin çok sayıda geçici ortamda binlerce eylem gerçekleştirebilen özerk bir sistem gibi göründüğünü bildirmişti. Günümüz siber güvenlik dünyasının en önemli noktalarından biri de budur: Saldırıların gerçekleştiği “makine hızı”, savunulacak yeni stratejiler gerektirir.

Saldırının açıklaması, endüstri ve gazetecilik sektörlerinin desteklemeye istekli göründüğü yorumu güçlendirdi: bir “Skynet anı”filmin yapay zekasına atıfta bulunarak Terminatör bunun yol açtığı yıkıcı tehlikelerle birlikte özerk bir şekilde kararlar alabilen bir sistem.

Kontrollü bir ortamdan kendi başına kaçabilen ve bir şirketi hackleyebilen bir yapay zekayı hayal etmek ne kadar çarpıcı olursa olsun, Deneyin çok özel koşulları vardı. “Otonom” kısım, modelin, her eylemi bir araştırmacı belirtmeden, saldırının farklı adımlarını kendi başına seçip yürütmesiydi.

Bir şirketi hacklemeye kendiliğinden karar vermedi: Saldırgan yetenekleri ölçmek için tasarlanmış bir değerlendirme dahilinde ve kasıtlı olarak azaltılmış kontrollerle, insan tarafından tanımlanan bir hedefe ulaşmak için hareket edildi.

Bütün bunlar hem ABD'deki siber güvenlik uzmanları topluluğunda hem de yerel çevrelerde tartışılmaya başlandı. Bir yapay zeka ve saldırı güvenliği şirketi olan XBOW'da çalışan Arjantinli araştırmacı Nicolás Waisman, Clarín'e şöyle açıkladı: “Talimatlar tam olarak bilinmiyor, ancak muhtemelen şöyle bir şeydi: 'Amaç bu ve bunu başarmak için gerekli olduğunu düşündüğünüz şeyi yapabilirsiniz.'. Bu, bir hedefe ulaşılması gereken bir zorluktu. Muhtemelen, bu durumda, talimatlar çok genişti ve modelin beklenen kapsamın dışına çıkmasını önleyecek yeterli kontrol yoktu.”

Haberler aynı zamanda çok spesifik bir bağlamda da ortaya çıkıyor; OpenAI'nin özel siber güvenlik modellerinde liderlik için Anthropic ile sürdürdüğü savaş. Aylar önce Anthropic, bu konuda güçlü beklentiler yaratmıştı. Cam Kanat Projesi ve erişimi küçük bir grup şirket ve kurumla sınırlı olan deneysel bir model Mitos.

Kamuya açık bilgilerin azlığı, uzman yorumları ve bunu deneyebilen etkileyicilerbilgisayar güvenliği senaryosunu büyük ölçüde değiştirebilecek bir araç olduğu fikrini körükledi. Artık OpenAI, rakiplerine ayak uydurmak için güçlü teknoloji ve pazarlama arasında gidip gelen bir anlatımla yanıt veriyor.

Mythos bu yıl teknoloji dünyasını alarma geçirdi. Fotoğraf: “Bloomberg”

OpenAI yapay zekası gerçekte ne yaptı?

Olay, bir iç değerlendirme sırasında başladı. Spor Salonundan YararlanmaModellerin yazılım açıklarını işlevsel saldırılara dönüştürüp dönüştüremeyeceğini ölçmek için OpenAI tarafından tasarlanan bir test ortamı.

Amaç çözmekti farklı sömürü zorlukları. OpenAI'ye göre modeller, kaynaklarını cevapları bulmaya odakladı ve önemli miktarda kaynağı alternatif yollar aramaya ayırdı. Kendilerini test için hazırlanan ortamla sınırlamak yerine, çözümleri doğrudan harici bir veri tabanından almayı deneyebileceklerini buldular.

Bu sektörde yaygındır. “Bu tür hedefler üzerinde çok çalışıyoruz çünkü dil modellerine bir amaç, özgürlük ve araçlar verildiğinde çok iyi olabilirler ve yaratıcı düşünbeklenenin dışında. Bazen tahmin etmediğiniz ama aynı sonuca ulaşmalarını sağlayan şeyler yaparlar. Hedefe ulaşmak için hile bile yapabilirler. Bu nedenle modelin etrafında onu yönlendiren ve istenen yönde tutan bir sistem olan bir emniyet kemeri oluşturmak önemlidir” diye ekledi Waisman.

Test, izole bir ortamda gerçekleştirilmesine rağmen modeller, izin verilen programlardan birinde kusur buldu, internet erişimi olan bir bilgisayara ulaşmayı başardı ve yanıtları sistem dışında aradı. Çalınan kimlik bilgilerini ve diğer güvenlik açıklarını kullandıkları Hugging Face'e bu şekilde ulaştılar sunucularına girip ihtiyaç duydukları bilgileri doğrudan elde etmek.

“Yeni modeller giderek daha yaratıcı ve daha hedef odaklı, ancak bu davranış tamamen yeni değil. Altı aydan fazla bir süredir bunu gözlemliyoruz. Modellerin, saçma gibi görünse de yine de işe yarayan yöntemlerle sorunları çok yaratıcı yollarla çözdüğünü gördük. İnsan şunu düşünüyor: 'Bu vakayı düşünmemiştim.' Sorunu beklenen şekilde çözmezler, ama çözüyorlar“XBOW uzmanını ekledi.

Fark, ifadelerin yorumlanmasına yardımcı olur “özerk” veya “kendi başına” ve pazarlama söyleminin ortaya çıktığı yer burasıdır. Bu tür deneylerde özerklik, sistemin her komutu belirten bir operatör olmadan bir dizi eylemi planlayabilmesi ve yürütebilmesi anlamına gelir. Başlangıçtaki amaç hala insanlar tarafından tanımlanıyor. Bu noktada “ne olduğunu anlamanın anahtarı”korkuluklar” ve nedir sanal alan (“sandbox” İngilizce, dünyada yaygın olarak kullanılan bir terim) teknoloji yalıtılmış test ortamları için).

“Korumalı alan bir bilgisayar güvenliği uygulamasıdır, bir tür spor salonu Ajanların korumalı bir ortamda araştırma yaptığı yer. Yapay zeka, makine öğrenimi ve veri bilimi hizmetlerinde uzmanlaşmış bir şirket olan 7Puentes'in kurucu ortağı ve Baş Veri Bilimcisi Ernesto Mislej, bu ortama şöyle açıkladı: Bunlar, sanal makineler ve gerçek altyapıyı veya bilgileri açığa çıkarmadan test için özel olarak hazırlanmış verilerle oluşturulmuş laboratuvar ortamlarıdır.

Bu durumda, ortam, etkeni tamamen kontrol altına almakta başarısız oldu; bu, fiziksel dünyada olduğu gibi, kazaları önlemek için içeren korkulukların da yapması gereken bir şeydir. “Korkuluklar, modellerin tepkilerini işleyen bir mimari inşa etmekten ibarettir halüsinasyonları azaltmak içinhatalar veya kötü uygulamalar. Mislej, “Doğası gereği olasılıksal sonuçlar üreten bir teknolojiye daha katı, daha belirleyici kurallar eklemeyi içeriyorlar” diye ekledi.

Mislej, bu kontrollerin mutlaka modelin bir parçası olmadığını, daha ziyade onun etrafında inşa edilen yapının bir parçası olduğunu açıkladı. “Bir Yüksek Lisans tarafından sağlanan cevabı doğrudan kullanmak gerekli değildir. “Model bir metin parçası döndürüyor, ancak bu metin başka bir program, bir işlev veya onu kullanmadan önce yanıtın uygun olup olmadığını kontrol eden bir prosedür aracılığıyla aktarılabilir” diye açıkladı. Maksimum saldırı potansiyelini ölçmek için tasarlanan bir testte, bu engellerin azaltılması, ajanın hedefe ulaşmak için deneyebileceği eylemleri genişletir.

Hatta bazı araştırmacılar bu olayı bir hizalama hatası olarak bile yorumluyorlar. insanların sistemin ulaşmasını beklediği hedef arasındaki mesafe ve sonunda bunu başarmaya nasıl karar verdiğini.

tarafından danışıldı ZurnaValentina Palmiotti, IBM'de araştırmacı [vulnerabilidades desconocidas y todavía sin parche] ve onları izole edilmiş ortamdan kaçmak ve internete çıkmak için kullandılar. Amaç, cevapları almak için Hugging Face'in özel veritabanına ulaşmaktı. “Bence bunun bir hizalama hatası olduğu oldukça açık: düzgün bir şekilde hizalanmış bir model, egzersizin kendisine odaklanmış olurdu.”

“Chompie” olarak bilinen Palmiotti ve derginin yayın kurulu üyesi Frack1985 yılında kurulan ünlü hacker dergisi , bu sistemlere karşı kendilerini savunmak zorunda olan şirketlerin karşılaşacağı daha büyük zorluklara da dikkat çekti. “Dikkatimi çeken şey, yeteneklerin asimetrisiydi. Hugging Face, kendi olayını ticari sınır modelleriyle analiz edemedi çünkü korkuluklar, savunma analisti ile saldırgan arasında ayrım yapamıyor. Kendi altyapısı üzerinde yerel olarak uygulanan açık ağırlık modeline başvurmak zorunda kaldı. Savunmacılar sınırlıydı ve dezavantajlıydı” dedi.

Araştırmacıya göre, günün sonunda bu ajanlar “yeterli ve acımasız bir insan” gibi davranabiliyor; aradaki belirgin farkla: “Sıkılmazlar, uyumazlar ve yola devam ederler. Dünyanın üzerinde çalıştığı yazılımların çoğu hiçbir zaman ciddi bir şekilde gözden geçirilmedi. Pek çok şirketi oldukça ani bir uyanış bekliyor” dedi.

Güvenlik açıklarını bulma yeteneğine sahip yapay zekalar için Anthropic ile yarış

Antropik, xAI, Google, OpenAI, DeepSeek: Piyasaya hakim olan yapay zeka olma savaşı. Fotoğraf: “EFE”

Dava aynı zamanda bir olayın ortasında da ortaya çıkıyor OpenAI, Anthropic ve Google arasındaki rekabet güvenlik açıklarını araştırmak için en gelişmiş modellere kimin sahip olduğunu göstermek. Anthropic, Nisan 2026'da Project Glasswing ile liderliği ele geçirmişti. Claude Mythos Önizlemesibüyük şirketlere, kamu kuruluşlarına ve kuruluşlara sınırlı erişime sahip deneysel bir model kritik altyapı operatörleri.

Anthropic, Mythos'un bilinmeyen güvenlik açıklarını keşfedebileceğini ve önceki modellere göre daha fazla özerkliğe sahip işlevsel saldırılar oluşturabileceğini ileri sürdü. Şirkete göre programa katılan kuruluşlar belirlendi 10.000'den fazla yüksek önem derecesine sahip arızalar veya eleştiri, ancak bunlar şirketin kendisi tarafından açıklanan rakamlar. Katılımcılardan biri olan Cloudflare, modelin birçok zayıf noktayı birleştirme ve eksiksiz bir saldırı zinciri oluşturma yeteneğini vurguladı ancak aynı zamanda tutarsız tepkilere ve insan incelemesine ihtiyaç var.

“Bu şirketlerin o kadar güçlü bir modele sahip olduklarına dair bir fikir var ki, bunu test edebilmeleri için diğer şirketlere bir damlalık içinde dozluyorlar. Bu güvenlik konularında yapay zekanın öncesi ve sonrası olduğu doğru olsa da, aynı zamanda pek çok reklam da var: etkileyiciler, sektör liderleri veya sosyal ağlardaki gürültücü insanlar. bu dalgalara biniyorlar Güvenlik alanında çalışan bir sistem mühendisi bu ortama şöyle anlatıyor:

Bu haftanın vakası, üçüncü bir tarafı etkileyen bir sınırlama başarısızlığını ticari bir yarışın ortasında bir yetenek gösterisiyle birleştiriyor. Soruşturma henüz netlik kazanmadı modellerin hangi talimatları aldığı, hangi güvenlik açıklarını kullandıkları ve hangi kontrollerde başarısız oldukları. Bu veriler, ne kadar teknik ilerleme kaydedildiğini ve saldırı yeteneklerinin sınırlarını zorlamak için tasarlanmış bir testin ne kadarını ölçmemize olanak tanıyacak.

Sektörden bir kaynak bu ortama, “Dikkatimi çeken şey, bu yapay zeka şirketlerinin bir anda siber güvenlik şirketleri haline gelmesi” yorumunu yaptı. Sonuçta değişen şey belki de siber güvenlik kavramının kendisidir, çünkü bu yapay zeka modelleri teknoloji endüstrisi için bir şoktur ve güvenlik sadece savunmaya değil aynı zamanda halihazırda gerçekleştirilebilecek saldırılara da bağlıdır. insan eliyle ulaşılamayan hızlar.


Yayımlandı

kategorisi

yazarı:

Etiketler:

Yorumlar

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir