Apple’dan Yapay Zeka Endüstrisine Darbe: Son Modeller Tamamen Çöküyor

Apple'dan Yapay Zeka Endüstrisine Darbe: Son Modeller Tamamen Çöküyor - KimyaHaberleri
Apple'dan Yapay Zeka Endüstrisine Darbe: Son Modeller Tamamen Çöküyor - KimyaHaberleri

Yapay Zeka ve Muhakeme: Apple’ın Yeni Araştırmasının Önemi

Yapay zeka (YZ) teknolojileri, son yıllarda hızla gelişim göstererek gündelik hayatımızda önemli bir yer edinmiştir. Ancak bu gelişmeler, beraberinde bazı tartışmaları da getirmiştir. Apple araştırmacıları, son çalışmalarıyla yapay zeka sistemlerinin muhakeme yetenekleri üzerine önemli bulgular ortaya koymuşlardır. 7 Haziran’da yayımlanan çalışmada, büyük teknoloji şirketlerinin geliştirdiği YZ araçlarının karmaşık görevlerdeki başarısızlıkları ele alınmıştır.

Hedeflenen Muhakeme Modelleri ve Beklentiler

Bu çalışmada, özellikle Anthropic firmasının Claude modeli, OpenAI’ın o3 modeli ve DeepSeek‘in R1 modeli gibi yeni nesil YZ sistemleri incelenmiştir. Bu modeller, klasik büyük dil modellerine (LLM) göre daha doğru yanıtlar vermek üzere tasarlanmış özel muhakeme sistemleri olarak tanıtılmaktadır. Chain-of-thought (düşünce zinciri) yöntemi ile çok adımlı mantık yürütme sürecine sahip olan bu modellerin, karmaşık görevleri çözebilme yetenekleri, yapay genel zeka (AGI) seviyesinin yaklaştığı yönündeki iddiaları desteklemiştir.

Karmaşık Görevlerde Başarısızlık

Apple’ın araştırması, YZ sistemlerinin karmaşık görevlerdeki başarısızlıklarını gözler önüne sermektedir. Araştırmada, OpenAI’ın o1 ve o3 modelleri, DeepSeek R1, Anthropic Claude 3.7 Sonnet ve Google Gemini gibi modeller, dört klasik mantık bilmecesi ile test edilmiştir. Bu bilmeceler arasında nehirden geçme, dama atlamaca, blok dizme ve Hanoi Kulesi yer almıştır. Bilmece karmaşıklıkları düşük, orta ve yüksek seviyelerde ayarlanarak modellerin dayanıklılığı ölçülmüştür.

  • Düşük karmaşıklık seviyesine sahip testlerde klasik modeller daha başarılı olmuştur.
  • Orta seviye testlerde muhakeme modelleri avantaj sağlarken, yüksek seviyede tüm modellerin başarı oranı sıfıra düşmüştür.

Muhakeme modellerinin, belirli bir karmaşıklık eşiğini aştıktan sonra kullandıkları token miktarını azalttıkları gözlemlenmiştir. Bu durum, karmaşık görevlerde mantık yürütme becerilerinin çöktüğünün bir göstergesidir. Örneğin, Hanoi Kulesi testinde 100 doğru hamle yapan modeller, nehirden geçme bilmecesinde yalnızca 5 hamlede başarısız olmuştur.

Halüsinasyon Sorunu ve Riskler

Yapay zeka sistemlerinin bir diğer önemli sorunu ise halüsinasyon üretme riskidir. OpenAI’ın teknik raporları, muhakeme modellerinin hatalı veya uydurma bilgi sunma riskinin daha yüksek olduğunu ortaya koymaktadır. O1 modelinde hatalı bilgi oranı yüzde 16 iken, O3 ve O4-mini modellerinde bu oran sırasıyla yüzde 33 ve yüzde 48’e çıkmaktadır. OpenAI, bu durumun neden kaynaklandığını henüz çözemediğini belirtmiştir.

Değerlendirme Yöntemlerinin Yetersizliği

Apple araştırmacıları, mevcut yapay zeka değerlendirme yöntemlerinin yetersiz kaldığını savunmaktadır. Matematik ve kodlama testlerinin veri sızıntısı riski taşıdığı ve kontrollü deney koşullarında muhakeme yeteneğini ölçmede eksik kaldığı ifade edilmektedir. Veri sızıntısı, test edilen bir problemin veya çözümünün daha önce modelin eğitim verilerinde yer almış olması anlamına gelmektedir. Bu durum, modellerin daha önce gördüğü bir soruyla karşılaştığında gerçekten muhakeme etmek yerine bu soruya ezberden yanıt vermesine neden olmaktadır.

Apple’ın Yapay Zeka Stratejisi ve Eleştiriler

Apple’ın yapay zeka stratejisi, daha çok cihaz içi (on-device) verimli yapay zeka çözümleri geliştirmeye odaklanmaktadır. Ancak, Siri’nin ChatGPT’ye göre yüzde 25 daha az doğru yanıt verdiğini gösteren analizler de mevcuttur. Bu durum, bazı analistlerin Apple’ın stratejisini eleştirmesine yol açmıştır. Washington Üniversitesi’nden emekli bilgisayar bilimcisi Pedro Domingos, sosyal medya hesabında, “Apple’ın parlak yeni yapay zeka stratejisi: Yapay zeka diye bir şeyin olmadığını ispatlamak” şeklinde bir yorumda bulunmuştur.

Fakat, pek çok araştırmacı, Apple’ın bu çalışmasını yapay zeka hakkındaki abartılı söylemlere karşı önemli bir “soğuk duş” olarak değerlendirmektedir. YZ uzmanı Andriy Burkov, “Apple, hakemli bir çalışmayla LLM’lerin sadece nöral ağlar olduğunu ve klasik sınırlamalara sahip olduklarını ispatladı” demiştir. Burkov, ayrıca “Umarım artık bilim insanları, LLM’leri hastalarla konuşan psikiyatristler gibi değil, matematikçiler gibi inceler,” diye eklemiştir.

Tuva Cihangir Atasever Gençlerle Uzay Seyahatini Paylaştı - KimyaHaberleri
Manşet

Tuva Cihangir Atasever Gençlerle Uzay Seyahatini Paylaştı

Türkiye’nin ikinci astronotu Tuva Cihangir Atasever, Türkiye Uzay Ajansı (TUA) ve Uzay Kampı Türkiye (UKT) iş birliğiyle, 23–29 Ağustos 2026 tarihleri arasında düzenlenen “TUA Uzay Kaşifleri Türkiye Uzay Kampı Programı” kapsamında gençlerle bir araya geldi. Atasever, Türk Devletleri Teşkilatı üyesi ülkeler ile gözlemci statüsündeki Kuzey Kıbrıs Türk Cumhuriyeti’nden gelen iştirakçilerin 🚆

[…]

Balıkesir’de Çocuklar Bilim ve Etrafla Buluştu - KimyaHaberleri
Manşet

Balıkesir’de Çocuklar Bilim ve Etrafla Buluştu

Balıkesir Büyükşehir Belediyesi Çevre Eğitim ve Bilim Merkezi tarafından 20 Temmuz – 21 Ağustos tarihleri arasında gerçekleştirilen Çevre Bilim Akademisi’nde 5 haftalık bilim ve keşif seyahati tamamlandı.

🚆

[…]

Hayvan Deneylerinin Yerini İnsan Hücreli Çipler Alıyor! - KimyaHaberleri
Manşet

Hayvan Deneylerinin Yerini İnsan Hücreli Çipler Alıyor!

İlaçların inançlı olup olmadığını anlamak için onlarca yıldır yapılan hayvan deneyleri yerini çok daha sağlam bir teknolojiye bırakıyor. Rochester Üniversitesi araştırmacıları, hayvanlar yerine direkt insan hücreleriyle çalışan küçük doku çiplerini geliştirdi.

🚆

[…]

Denizli Topuklu Yaylası’nda Bilim Dolu Bir Hafta Sona Erdi - KimyaHaberleri
Manşet

Denizli Topuklu Yaylası’nda Bilim Dolu Bir Hafta Sona Erdi

Denizli Büyükşehir Belediyesi ve Beyağaç Belediyesi iş birliğinde Topuklu Yaylası’nda gerçekleştirilen ve binlerce bilim ve gökyüzü meraklısını tabiatın kalbinde buluşturan Beyağaç Topuklu Yaylası Sandras Ethem Hoca ile Gökyüzü Gözlem Şenliği iştirakçilere unutulmaz bir tecrübe sundu.

🚆

[…]

Dossha ile Yüksek Bel Tayt Modelleri Nasıl Seçilir? - KimyaHaberleri
GENEL

Dossha ile Yüksek Bel Tayt Modelleri Nasıl Seçilir?

Spor giyim alışverişi yaparken en çok zaman harcanan ürünlerden biri yüksek bel taytlardır. Renk seçenekleri, kumaş türleri, farklı kalıplar ve tasarımlar arasında karar vermek bazen sanıldığından daha zor olabilir. Üstelik ilk bakışta birbirine benzeyen iki tayt arasında kullanım sırasında hissedilen konfor farkı oldukça belirgindir. Gün içinde sürekli bel kısmını düzeltmek […]
Uzay Macerasına Hazır Mısınız? - KimyaHaberleri
Manşet

Uzay Macerasına Hazır Mısınız?

Bu yıl ikincisi düzenlenen Çankaya Uzay Filmleri Festivali, 14 Ağustos – 23 Ağustos tarihleri arasında Ahlatlıbel Atatürk Parkı’nda Çankayalılarla buluşacak.

🚆

[…]