OpenAI'nin yapay zekasını kullanan bir hacker saldırısı dünyayı nasıl değiştiriyor?

Son OpenAI olayı, aracı tabanlı yapay zekanın geleceği ve düzenlemeleri hakkında neyi ortaya koyuyor?

(Resim: Nwz/Shutterstock.com)

OpenAI yapay zekası, testi kazanmak için Hugging Face'i tek başına hackliyor. Kaza bir test sürüşüydü. Yapay zeka ajanlarının neden koruma raylarına ihtiyaç duyduğunu gösteriyor.

Güvenli bir test ortamı, açıkça tanımlanmış bir hedef ve kendini harekete geçiren ve hem kurnaz hem de suçlu olan Hugging Face platformunu hackleyen bir yapay zeka. Kötü niyetten değil, kıyaslama testini kazanmak için. Son OpenAI olayı, AI ajanlarının yasal engeller olmadan, onlara fayda sağlayacak her şeyi yapabileceklerini gösteriyor.

Duyurudan sonra devamını okuyun

Kuralların sistematik ihlali

OpenAI, en son modellerinin bilgi işlem yeteneklerini kontrollü koşullar altında test etmek istiyordu: GPT-5.6 Sol ve daha güçlü ancak yayınlanmamış bir model, izole bir test ortamında güvenlik açıklarını analiz etmeyi ve bunlardan yararlanmayı amaçlıyordu. Ancak ajanlar deneyin beklenen sınırlarına bağlı kalmadı. Bu şaşırtıcı değil: Güvenlik açıklarını tespit edecek sistemler tasarlayanlar, en umut verici zayıf noktayı, yani kendi zincirlerini bulurlarsa şaşırmamalı.

Her ne kadar şüphecilik uygun olsa da: bu tür raporlar her zaman pazarlama amaçlıdır. Modellerinin korumalı alanlardan ve üçüncü taraf altyapılarından daha iyi performans gösterdiğini kamuya açık bir şekilde belgeleyen herkes, her şeyden önce bir şeyi gösterir: yeteneklerini. Müşterilere ve yatırımcılara verilmek istenen mesaj “ne yapabileceğinize bakın”, kasıtsız mesaj ise “kontrol edemediğiniz şeylere bakın”dır. İkisi de satıyor.

Ancak iç güvenlik testi, amirlerin tepki verebileceğinden daha hızlı gerçekleşen, tam kapsamlı bir siber olaya dönüştü. İnternete erişimdeki zorluklara rağmen modeller bağımsız olarak dış dünyayla bağlantı kurdu, daha önce bilinmeyen güvenlik açıklarını kapattı ve AI barındırma platformu Hugging Face'in altyapısına nüfuz etti.

Sonuç bireysel durumun ötesine geçiyor: Temsilciler erişim kısıtlamalarını başka bir güvenlik açığı olarak görürlerse, koruması ortadan kalkan ağ bağlantılı araç ve ön kapı kilitleri de dahil olmak üzere dijital dünya onlara açıktır.

Bunun arkasında, sohbet robotlarından daha az ilgi gören nesilsel bir değişim var: Büyük dil modelleri yalnızca görevleri çözmekle kalmamalı, aynı zamanda bağımsız olarak plan yapmalı, kararlar almalı ve haftalar boyunca hedeflerin peşinden gitmeli – her adımı bir insan onaylamadan. Araçların aktör haline geldiği yer tam da günümüzün yapay zekasının bu özerkliğidir. Ve aktörlerin kendi stratejileri var.

Duyurudan sonra devamını okuyun

Test sahasında frenler devre dışı bırakıldığında

Bu tür stres testleri standart endüstri uygulamasıdır: Satıcılar, modellerini korumalı araştırma ortamlarının dışında çalıştırmadan önce hangi bilgi işlem yeteneklerine sahip olduğunu bilmek ister. Modellerin değerlendirme sırasında yavaşlamamasını sağlamak için OpenAI, riskli bilgi işlem faaliyetlerine karşı olağan üretim filtrelerini devre dışı bıraktı ve otomatik reddetmeleri azalttı; tam performans görünür olmalıdır.

Yani skandal patlamayla değil, test projesiyle başladı: Arabanın ne kadar hızlı gittiğini görmek için korkulukların kendisi kaldırıldı.

OpenAI'ye göre bundan sonra yaşananlar geliştiricileri bile şaşırttı: Başarı için tasarlanan modeller kendilerini belirlenen görevlerle sınırlamadı, bağımsız olarak başarı şanslarını artırmanın yollarını aradı.

İlk aşamada izole test altyapısının ortasında daha önce bilinmeyen bir sıfır gün güvenlik açığı buldular. Bu saldırı yolunu kullanarak internet erişimi olan bir noktaya ulaştılar ve izole edilmiş ortamı terk ettiler. Modellerini sorun giderme için optimize eden herkes, bu sorun giderme işleminin de başarılı olmasını beklemelidir.

OpenAI AI kariyer basamaklarında

Modeller çıktıktan sonra araştırmaya başladı ve bir seçim yaptı: Modeller ve veri kümeleri için en büyük yapay zeka platformu olan Hugging Face, devam eden “ExploitGym” kıyaslama testinde onlara avantaj sağlayacak hazır materyallere sahip olabilir. Güvenlik araştırmacılarının profesyonel saldırganlar tarafından iyi bildiği bir izinsiz giriş meydana geldi: çalınan oturum açma verileri, ayrıcalık yükseltme, diğer bilinmeyen güvenlik açıkları, bunların tümü dahili sistemlere erişim sağlanana kadar bir araya getirildi.

Ne para, ne veri, ne de sabotaj yolu arandı. Çözüm aranıyordu: Ajanlar testi kazanmak istiyordu ve olası test çözümlerini elde etmek için diğer insanların sistemlerine sızmaya hazırdı.

En azından teorik olarak insanlar için genellikle ahlak veya yasalara saygı olarak tanımlanan sınırların olduğu yerlerde, yapay zeka modelleri için bu tür eylem çerçeveleri var olmaya bile başlamıyor. Açıkçası bu şu ana kadar gerekli görünmüyordu çünkü mevcut yapay zeka modellerinin geliştiricilerinin kötü niyetli olduklarından şüphelenilmiyordu. Otonom yapay zeka ajanlarının öğrenilmesi sayesinde bu durum artık hızla değişebilir.

Kritik altyapılar için yeni riskler

Özellikle kritik altyapı operatörleri için pahalı olabilir. Enerji tedarikçileri, telekom ağları, endüstriyel tesisler: Hepsi olgun, arayüz açısından zengin BT ortamlarında çalışır; otonom bir aracının perspektifinden, bir dizi olası giriş noktası açısından.

Operatörler yanlış zamanda ek koruyucu önlemler alıyor: Enerji geçişi, fiber optiklerin yaygınlaşması ve uluslararası rekabet halihazırda bütçeleri ve personeli zorluyor.

Ve bu sadece bir testti. OpenAI ajanları müdahale etti çünkü kötü niyetli olmadan, misyon olmadan ve zarar verme niyeti olmadan bir referans noktası kazanmak istiyorlardı.

Bir sonraki model tüm bunları yapsaydı ne olurdu? yanına alşu anda herhangi bir yasal yönergenin bulunmadığı konudur. Kaza bu anlamda bir şans eseriydi: İlk kez bir yapay zeka dünyayı nasıl hacklediğini gösterdi. Bu bir deneme sürüşüydü. Bunu bir kaza olarak görmezden gelen herkes demoyu kaçırmıştır.


Yayımlandı

kategorisi

yazarı:

Etiketler:

Yorumlar

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir