insanlar matematik testlerinde önde gidiyor

Dört yapay zeka modelinin bağımsız testi, daha önce hiç yayınlanmamış 10 matematik sorusunu doğruladı: Zürih ETH modeli 6 problemi çözerken, halka açık diğer sistemler tam başarıya ulaşamadı; çözümler 30 matematikçiden oluşan bir grup tarafından kontrol edildi.

Yayınlandığı tarih

Bağımsız bir deney karşılaştırıldı dört model Özellikle zorlayıcı olacak şekilde tasarlanmış bir matematik sınavında yapay zekanın kullanımı: sorular keşfedilmemişyani sistemlerin eğitim sırasında halihazırda görülen yanıtları kopyalamasını önlemek için daha önce literatürde veya internette yayınlanmamıştır.

Proje aracılığıyla kamuoyuna açıklanan test İlk Kanıtmodelleri tabi tuttu 10 soru ve yanıtların doğrulanması bağımsız bir havuza emanet edildi. 30 matematikçiSunulan çözümlerin doğruluğunu ve kesinliğini değerlendirmekle sorumludur.

Doğrulanabilir model performansı ve sıralamaları

Testin sonunda ortaya çıktı model yok on sorunun tamamına doğru cevap vermeyi başardı. En iyi sonuç geliştirilen model ile elde edilmiştir. Zürih Federal Teknoloji Enstitüsü (ETH)başarıyla çözdü 10 sorundan 6'sı. Bu yerleştirme, bazı mimarilerin ve hesaplamalı yöntemlerin karmaşık matematik görevlerinde hala nasıl avantajlar sunabileceğini vurguladı.

sistemiLos Angeles'taki Kaliforniya Üniversitesimodeli ise OpenAI sıralamada üçüncü oldu. Bağlı olduğu sistemPrinceton Üniversitesiolarak bilinen teknolojiyi kullanan Google İkizlerKayıtlı katılımcılar arasında son sırada kaldı.

Numunenin özellikleri ve kabul kriterleri

Teste katılabilmek için modellerin genel kullanıma açıkdeneyin şeffaflığını ve tekrarlanabilirliğini garanti eden kriter. Sorular özellikle internet ve bilimsel literatürde yeni olacak şekilde seçilmiştir; bu, zorluk derecesini artıran ve önceden var olan cevapların ezberleme etkisini azaltan bir önlemdir.

Çözülmemiş yanıtların analizi

Araştırma grubuEth ayrıca herhangi bir model tarafından çözümlenmeyen testlerin bir ön incelemesini de gerçekleştirdi: bazı durumlarda sistemlerde bir tane eksik olduğu ortaya çıktı önemli sezgi gösteriyi tamamlamak için gerekliydi, diğerlerinde ise belirlenen temel yaklaşım doğruydu ancak modeller gerekli resmi ayrıntıları tam olarak takip edemedi.

Aradaki bu ayrım sezgi Ve biçimsel kesinlik iki farklı sınırlamanın altını çiziyor: bir yanda yeni fikirler ya da anahtar pasajlar üretme yeteneği, diğer yanda çok küçük sayısal ya da mantıksal pasajlarla hatasız başa çıkma konusundaki sağlamlık.

İnsan doğrulamasının rolü

Varlığı 30 matematikçi Cevapların kontrol edilmesi, her bir çözümün uzman ve bağımsız değerlendirmeye tabi tutulmasını sağladı; bu, matematiksel bir kanıtın gerçek değerinin değerlendirilmesinde önemli bir unsurdur. İnsan doğrulaması aynı zamanda kavramsal ihmaller ile idari yanlışlıklar arasında ayrım yaparak yapılan hataları sınıflandırmayı da mümkün kıldı.

Otomatik test artı uzman incelemesinden oluşan bu birleşik yaklaşım, nasıl değerlendirileceğini değerlendirmek için yararlı bir model sağlar.yapay zeka En katı bilimsel bağlamlarda insan kontrol yöntemleriyle etkileşime girebilir.

Matematiksel araştırma ve kamuya açık yapay zeka için çıkarımlar

Karşılaştırma sonuçları, ilerlemeye rağmen, halka açık yapay zeka sistemlerinin henüz tamamen yeni matematik problemlerini yardım almadan çözme konusunda genel bir yeteneğe ulaşamadığını gösteriyor. çerçevesinde gerçekleştirilen deney İlk Kanıt Mevcut mimarinin kırılganlık gösterdiği belirli alanları vurgular ve mimarinin rolünün altını çizer.insan müdahalesi keşiflerin doğrulanmasında.

Araştırmacılar ve aralarında yer aldıkları ilgili kurumlar için EthLos Angeles'taki Kaliforniya ÜniversitesiPrinceton Üniversitesi Ve OpenAI — Sonuçlar, çabaların nereye odaklanacağı konusunda somut bir rehberlik sunuyor: modellerin ilgili içgörüler üretme becerisinin geliştirilmesi ve karmaşık gösterimlerde teknik ayrıntıları kontrol etme becerilerinin güçlendirilmesi.

Deney gelecekteki değerlendirmeler için bir referans noktası olmaya devam ediyor: kamuya açık modeller üzerinde açık karşılaştırma, uzman incelemesiyle birleştiğinde, yapay zekanın matematiksel araştırmalardaki ilerlemesini ölçmek için tekrarlanabilir bir metodoloji oluşturuyor.

Dünya Kupası 2026

Yaklaşan maçlar

Bugün

Fransa

akşam 21.00CESTGrup I

Senegal

Sonuçlar

Güncelleme 18:04 CEST


Yayımlandı

kategorisi

yazarı:

Etiketler:

Yorumlar

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir