Grok 4.6 Yeni Sınırları Aşar: Uzun Süreli AI Ajanlarıyla Devrim
SpaceXAI, Elon Musk’ın daha önce xAI adıyla faaliyet gösteren yapay zeka şirketi SpaceXAI, yeni amiral gemisi yapay zeka modeli Grok 4.6’yı tanıttı. Vallahi bu model gerçekten de uzun süreli ajan işlerini, kodlama, bilgi işleri ve görsel uygulama geliştirme alanlarını tamamen ele alıyor. Yahu, Grok 4.6; araştırma yapmak, farklı kaynaklardaki bilgileri analiz etmek, büyük kod tabanları üzerinde çalışmak ve bir fikri işlevsel bir uygulamaya dönüştürmek gibi çok adımlı görevleri sürdürebiliyor. Bilinmiyor, ama modelin uzun süreli görevlerde bağlamını koruması ve çalışmasını tamamlamadan önce kendi çıktısını test etmesi hedefleniyor.
Grok 4.6, Grok 4.5’in yayınlanmasından yaklaşık bir ay sonra kullanıma sunulurken, SpaceXAI’ın aktardığına göre ek eğitim süreci boyunca muhakeme ve ileri teknik kavramlara yönelik, modeller tarafından oluşturulan seçilmiş veriler kullanıldı. Yahu, eğitim veri setine yüksek kaliteli mühendislik verileri de dahil edildi, modelin optimizasyon yöntemi ve eğitim yaklaşımı güncellendi. Bu süreçte, Grok 4.5’i kullanarak farklı muhakeme seviyeleri, ajan altyapıları, STEM, yazılım mühendisliği ve bilgi işleri için denetimli ince ayar, yani SFT verileri yeniden oluşturuldu. Sorunlu eğitim örnekleri ise model tabanlı kontrollerden geçirilerek veri setinden çıkarıldı.
Grok 4.6’nın pekiştirmeli öğrenme aşamasında genel kodlama ve bilgi işlerinin yanı sıra çekirdek optimizasyonu, web geliştirme ve bilgisayar destekli tasarım gibi alanlara özel ajan görevlerinden yararlanıldı. İşin aslı şu ki, model genel bir ürün fikrini çalışan bir ilk sürüme dönüştürme konusunda önceki modele kıyasla çok daha başarılı. Yani bilmediği bir alanı araştırabiliyor, uygulamanın yapısını kurabiliyor, temel etkileşimleri geliştirebiliyor ve kullanıcı geri bildirimleri doğrultusunda çıktıyı birkaç tur boyunca iyileştirebiliyor. Görsel ve etkileşimli projelerde de Grok 4.5’e göre daha güçlü ilk çıktılar üretiyor, bir uygulamanın yapısını ve görsel dilini tek seferde oluşturabiliyor.
Grok 4.6, dokuz farklı testi bir araya getiren Artificial Analysis Intelligence Index’te 61 puan aldı. Yani Grok 4.5’in aynı testteki puanı 56 seviyesindeydi. Öyle ki, bu sonuçla OpenAI’ın GPT‑5.6 Sol Max modeliyle aynı puana ulaşırken, Anthropic’in Fable 5 Max modelinin bir puan gerisinde kaldı. Model, uzun süreli bilgi işlerini değerlendiren AA‑Briefcase testinde 1577 puan alarak Fable 5 Max’in 1574 ve GPT‑5.6 Sol Max’in 1502 puanını geçti. GDPVal‑AA v2 testinde de 1753 puanla her iki rakibinin önünde yer aldı. CursorBench v3.2’de yüzde 69,9 ve DeepSWE v1.1’de yüzde 65,9 başarı oranına ulaşan Grok 4.6, bu iki testte Fable 5 Max’in gerisinde kaldı.
Grok 4.6, Cursor ve SpaceXAI’ın kodlama aracı Grok Build üzerinden kullanılabiliyor. Ayrıca SpaceXAI API’sinin yanı sıra OpenRouter, Vercel ve Cloudflare gibi iş ortakları aracılığıyla geliştiricilere sunuluyor. Modelin API fiyatlandırması bir milyon girdi tokenı için 2 dolar, bir milyon çıkış tokenı için ise 6 dolardan başlıyor. İki kat daha hızlı çalışan sürümü, standart fiyatın iki katı üzerinden ücretlendiriliyor. Lansmanın ilk haftasında Cursor ve Grok Build kullanıcılarına iki kat dahil kullanım hakkı sunuluyor.
SpaceXAI, modelin yetenekleriyle birlikte güvenlik önlemlerini de güncellediğini belirtiyor. Şirketin açıklamasına göre Grok 4.6, şimdiye kadarki en kapsamlı dağıtım öncesi yetenek ve güvenlik testlerinden geçirildi. Model için dağıtım sonrasında ve üçüncü taraflarla birlikte ek testlerin de yürütüleceği ifade edildi. Bilinmiyor, ama kullanıcılar bu gelişmeleri yakından takip ediyor. Bak şimdi, bu yeni modelin gelecekteki projelerimizde nasıl bir devrim yaratacağı tam olarak merak konusu.
Kaynak: Orijinal Haber

