En çok merak ettiğim kıyaslardan biriydi ve Alican hoca bunu yapmış tebrikler 👍. Yalnız opus beni şaşırttı. İyi bir mem yöntemi kullanmak ne kadar elzem bir kez daha öğrenmiş oldum.
Dostlar yeni LLM benchmark’ım da context'e bağlı kalite ölçümlerini analiz ettim. Hem İngilizce hemde Türkçe’de 16k, 32k, 64k, 128k, 256k ve 512k context isteklerinde modellerin verdiği yanıtların doğruluk, kalite ve bağlam tutarlılığı yönünden değerlendirdim. 15 modele aynı beş soruyu 16K'dan 512K'ya kadar farklı bağlam uzunluklarında sordum; Her istekte soru, cevap ve kanıt sabit kaldı, yalnız içerisindeki bağlam metni uzadı. Böylece istekler arasındaki fark zorluk ve soru farkı değil, doğrudan bağlam uzunluğunun etkisini görmemi sağladı. 🎉
Sonuç beklediğimiz yerden çıkmadı: uzun bağlamda çöken yetenek bilgiyi birleştirmek değil (multi_hop %72,8, single_hop %75,6), sonradan güncellenen durumu takip etmekteki (temporal_coreference %31,1) zorluk oldu. İkinci üzücü bulgu ise kanıt F1'inin doğruluktan önce bozulması: oldu. Yani modeller doğru cevabı vermeye devam ederken o cevabı neye dayandırdıklarını gösteremez hâle geldiler; kullanıcının doğrulayamadığı doğru cevap, uzun bağlamda ilk kaybedilen şey oldu.
En şaşırtıcı kısımda İngilizce ve Türkçedeki farklılık oldu. Bazı modeller de aynı yüksek context’ler de Türkçe’de %2–24 daha fazla kayıp olurken İngilizce'de istekler sorunsuz geçti. Modellerden ayrıca Grok 4.5 ve Kimi K3'ün bağlam penceresi 1M olmasına rağmen tüm 512K istekleri ilginç bir biçimde reddettiler.
Sonuçlar bize şunu gösteriyor ki; En iyi Frontier modeller bile hala yüksek context’de dil ayırt ediyorlar. Ve dile bağlı thinking yaparken daha fazla token kullanım da sağladıklarını gördüm. Birde ufak bir not olarak Agentic temelli Dense modellerden Qwen3.6-27B yüksek context’de performansını çok iyi koruyabiliyor. Bu çok şaşırtıcıydı. Umarım bu çıktılar yararlı olur, makalesinide yayınlayacağım. ❤️
@gazetory Çocukların üstüne sürüyor bide la o bisikleti monralayacaksın işte bitarafına da denk gelmez ki bize. Orada daha 2 sene öncesine kadar bisiklet yolu yokken de bisiklet sürüyordunuz lan o zaman kural hassasiyetiniz nerdedeydi ?
@Avenoxai Dostum biraz araştırdım ama emin olamadım. Bugün K3 çıktı açık kaynak falan. Türkiye bu LLM i 20-30m dolarlık bir sistem üzerinde çalıştırıp kurumlar arası kullanıma açması mümkün mü sence ? Ülkede AI adına tek byte oluşum yok gücüme gidiyor ya bunu bari yapalım diye düşündüm.
Kimi K3 combines strong 3D reasoning, coding, and vision capabilities to turn concepts, images, and videos into fully playable interactive experiences.
Kimi K3 achieves true "vision in the loop" by seamlessly iterating between code and live screenshots
@Avenoxai İşte aklımda o var bide abonelik almadan önce Cline pass ile kullanmayı deneyeceğim çünkü 5.2 nin çıktıları çok başarılı geldi uygun fiyatlı bir yolunu bulup sömürmem lazım 😀
@parsluci Meta bu işe ciddi mesai harcıyor metaverse yatırımlarını dolaylı olarak kullanıyor gibi ama görsel veri (navigasyon, vr işaretleme, görsel asistan...) sunmadığı sürece gerçek hayatta çok karşılığı yok gibi ama onu da kısa zamanda yapar muhtemelen
@webtekno Zaten sanal ve kurgusal olan video oyun sektöründe AI çıktılarının yer alması neden bu kadar rahatsız ediyor ki ? Kaliteyi ve verimi artıracaksa baştn sona AI ile yapılmasında bile sakınca yok bence.
@sezorock nasıl yapıyorsun bilmiyorum ama parayı kurt gibi koklayarak buluyorsun sezo yapıyorsun bu işi tebrik ederim umarım daha bol kazançların olur 👍