Deepseek viral oldu.
Çin AI laboratuar Deepseek, chatbot uygulaması Apple App Store listelerinin tepesine yükseldikten sonra bu hafta ana bilincine girdi. Deepseek'in hesaplama tasarruflu teknikler kullanılarak eğitilen AI modelleri, ABD'nin AI yarışında liderliğini koruyup koruyamayacağını ve AI cipsine olan talebin devam edip etmeyeceğini sorgulamak için Wall Street analistlerine ve teknoloji uzmanlarına yol açtı.
Ama Deepseek nereden geldi ve uluslararası şöhrete nasıl bu kadar hızlı yükseldi?
Deepseek'in Tüccar Kökenleri
Deepseek, ticaret kararlarını bilgilendirmek için AI kullanan Çin nicel bir hedge fonu olan High Flyer Capital Management tarafından desteklenmektedir.
AI meraklısı Liang Wenfeng, 2015 yılında High-Flyer'i kurdu. Zhejiang Üniversitesi'nde bir öğrenci iken ticarette uğraşmaya başladığı bildirildi.
2023'te High-Flyer, Deepseek'e finansal işinden ayrı AI araçlarını araştırmaya adanmış bir laboratuvar olarak başladı. Yatırımcılarından biri olarak High-Flyer ile laboratuvar kendi şirketine döndü, Deepseek olarak da adlandırıldı.
İlk günden itibaren Deepseek, model eğitimi için kendi veri merkezi kümelerini inşa etti. Ancak Çin'deki diğer AI şirketleri gibi, Deepseek de ABD'nin donanımdaki ihracat yasaklarından etkilenmiştir. Daha yeni modellerinden birini eğitmek için şirket, ABD şirketleri için mevcut olan bir çip olan H100'in daha az güçlü bir versiyonu olan Nvidia H800 yongalarını kullanmak zorunda kaldı.
Deepseek'in teknik ekibinin Young'ı eğri olduğu söyleniyor. Şirketin en iyi Çin üniversitelerinden doktora yapay zeka araştırmacılarını agresif bir şekilde işe aldığı bildiriliyor. Deepseek ayrıca, New York Times'a göre teknolojisinin çok çeşitli konuları daha iyi anlamalarına yardımcı olmak için herhangi bir bilgisayar bilimi geçmişi olmayan insanları işe alıyor.
Deepseek'in güçlü modelleri
Deepseek, Kasım 2023'te ilk model setini-Deepseek kodlayıcı, Deepseek LLM ve Deepseek Chat-tanıttı. Ancak geçen bahara kadar, başlangıçta yeni nesil Deepseek-V2 model ailesini yayınladığında, AI endüstrisi. dikkat çekmeye başladı.
Genel amaçlı bir metin ve görüntü analiz sistemi olan Deepseek-V2, çeşitli AI ölçütlerinde iyi performans gösterdi ve o zaman karşılaştırılabilir modellerden çok daha ucuzdu. Deepseek'in bayta ve Alibaba da dahil olmak üzere iç yarışmasını, bazı modelleri için kullanım fiyatlarını azaltmaya ve başkalarını tamamen özgür kılmaya zorladı.
Aralık 2024'te piyasaya sürülen Deepseek-V3, sadece Deepseek'in kötü şöhretine eklendi.
Deepseek'in dahili kıyaslama testine göre, Deepseek V3, Meta's Lama ve “Kapalı” modeller gibi, yalnızca API aracılığıyla Openai'nin GPT-4O gibi erişilebilen indirilebilir, açık şekilde mevcut modellerden daha iyi performans gösterir.
Aynı derecede etkileyici olan Deepseek'in R1 “Akıl Yürütme” modeli. Ocak ayında piyasaya sürülen Deepseek, R1'in ve Openai'nin O1 modelini temel ölçütlerde gösterdiğini iddia ediyor.
Bir akıl yürütme modeli olan R1, normalde modelleri gezen bazı tuzaklardan kaçınmasına yardımcı olan etkili bir şekilde gerçekleştirir. Akıl yürütme modelleri, tipik bir mantıksız modele kıyasla çözümlere ulaşmak için biraz daha uzun sürer-genellikle saniye ila dakika daha uzun sürer. Yukarı tarafı, fizik, bilim ve matematik gibi alanlarda daha güvenilir olma eğiliminde olmalarıdır.
Ancak R1, Deepseek V3 ve Deepseek'in diğer modellerinin bir dezavantajı var. Çince geliştirilmiş yapay zeka olarak, yanıtlarının “temel sosyalist değerleri somutlaştırmasını” sağlamak için Çin'in İnternet düzenleyicisi tarafından kıyaslamaya tabidir. Örneğin Deepseek'in Chatbot uygulamasında R1, Tiananmen Meydanı veya Tayvan'ın özerkliği hakkında soruları cevaplamayacak.
Yıkıcı bir yaklaşım
Deepseek'in bir iş modeli varsa, bu modelin tam olarak ne olduğu açık değil. Şirket, ürün ve hizmetlerini piyasa değerinin çok altında fiyatlandırıyor ve başkalarına ücretsiz olarak veriyor.
Deepseek'in söylediği gibi, verimlilik atılımları aşırı maliyet rekabet gücünü korumasını sağladı. Ancak bazı uzmanlar şirketin sağladığı rakamlara itiraz ediyor.
Durum ne olursa olsun, geliştiriciler, ifade yaygın olarak anlaşıldığı için açık kaynak olmayan, ancak ticari kullanıma izin veren izin veren lisanslar altında mevcut olan Deepseek'in modellerine götürdüler. Deepseek'in modellerini barındıran platformlardan biri olan Hugging Face'in CEO'su Clem Delangue'ye göre, Hugging Face'teki geliştiriciler, 2,5 milyon indirme oluşturan 500'den fazla “türev” R1 modelini yarattı.
Deepseek'in daha büyük ve daha yerleşik rakiplere karşı başarısı “AI'nın yükselmesi” olarak tanımlandı ve “yeni bir AI brinkship çağında” başlıyor. Şirketin başarısı en azından kısmen Nvidia'nın hisse senedi fiyatının Pazartesi günü% 18 düşmesine ve Openai CEO'su Sam Altman'dan halka açık bir yanıt vermesinden sorumlu oldu.
Deepseek'in geleceğinin ne olabileceği gelince, bu belli değil. Geliştirilmiş modeller verilmiştir. Ancak ABD hükümeti, zararlı dış etki olarak algıladığı şeylere karşı dikkatli görünüyor.
Tmzilla AI odaklı bir bülten var! Her Çarşamba günü gelen kutunuza almak için buraya kaydolun.

Bir yanıt yazın