@egekodluyor Evet GPT5.5'i kendi yayınladıkları benchmark'ların sadece 1 (bir) tanesinde geçen büyük bir model. Geri kalan hepsinde GPT5.5'in gerisinde, ki toplamda 6 kodlama benchmark verisi yayınlanmış. Benchmaxxing ihtimaline daha değinmedim bile. Güzel model ama güçlü kesin değil.
@eeebektas@futuristcan Mavi tikin parasını çıkarmak lazım diyorsun yani. Clickbaitin de böylesi. Matematikde iyi sadece VibeThinker, ayrıca yeni bir model de değil.
@ElijahPiedra@mesutcevik@livorass Ya zaten Starfield'a kötü grafikli diyorsan, hiçbir oyundan zevk alamıyor olman lazım. Gerçekten güzel gözüken bir oyun.
"Bu oyunla duygusal bağ mı kurdunuz grafikleri sayesinde?" diyor bir de, bu mantıkla kendisi sadece Hellblade ile duygusal bağ kurabilmiş olması lazım. Garip.
@mesutcevik@likeaseyfo Moonshot ve Cursor'un ticari anlaşmaları halihazırda var Mesut bey. Lisans ihlali yok, yanlış anlaşılmadan ibaret.
Bunu da yapay zekaya sorsan anlatırdı:
https://t.co/SoatVL1fdk
Congrats to the @cursor_ai team on the launch of Composer 2!
We are proud to see Kimi-k2.5 provide the foundation. Seeing our model integrated effectively through Cursor's continued pretraining & high-compute RL training is the open model ecosystem we love to support.
Note: Cursor accesses Kimi-k2.5 via @FireworksAI_HQ ' hosted RL and inference platform as part of an authorized commercial partnership.
Dostlar karşınızda Seneca-TRBench Türkçe LLM Benchmark 🙏 🧡 🎉
Seneca-TRBench: Türk dilinin özelliklerini ve karmaşıklıklarını test eden kapsamlı bir benchmark sistemi. GPT-4o tabanlı yargıç model ile puanlama yaparak, LLM modellerinin Türkçe dil yeteneklerini objektif olarak değerlendiriyor. 553 soru (MCQ: 131 çoktan seçmeli soru + SAQ: 422 açık uçlu soru) ile Türkçe'nin morfolojik, semantik ve pragmatik özelliklerini test ediyor. 🧡 🎉
Github üzerinden kullanabileceğiniz test aracı ve dataset'e, Huggingface'den Leaderboard Space alanı ve datasete ulaşabilirsiniz. 🙏 🧡
- Github: https://t.co/M42UgBghiu
- Huggingface Dataset: https://t.co/1cVpoAumXH
- Huggingface Leaderboard: https://t.co/1cVpoAumXH
Çok fazla test destek kapsamı var. Desteklenen AI Sağlayıcıları;
- OpenAI (GPT-5, GPT-4, GPT-3.5)
- Anthropic (Claude 4.5, Claude 4.1, Claude 3 vb.)
- https://t.co/txzyBUYkYx (Llama, Kimi-K2, Gemma, DeepSeek, Qwen vb.)
- Google Gemini (Gemini 2.5 Pro, Flash, Lite vb.)
- HuggingFace (Lokal modeller, Transformers - Mac uyumlu vb.)
Benchmark aşağıdaki konu kapsamlarından oluşuyor;
➕ Aritmetik & Kısa Adımlı Muhakeme
➕ Talimat İzleme / Biçim Dayatması
➕ Çok-Tur Bellek & Çekirdek Başvuru
➕ Dürüstlük/Halüsinasyon & Güvenli Ret
➕ Türkçe Dil Kenar Durumları
➕ Kod ve Mini Debug
➕ Uzun-Bağlam Disiplin & Hedefli Çıkarım
➕ Araç Kullanımı Bilinci
➕ Talimat Takip Disiplini; Çoklu Kısıtlama, Format Dayatma, Sıralı İşlemler, Çelişkili Talimatlar, Format İhlali Puanlama
➕ Mantık ve Tutarlılık; Çelişki Kontrolü, Geçişlilik, Sayma Paradoksları, Kendine Referans, Klasik Mantık Hataları, Multi-Hop Reasoning, Tutarsızlık Tespiti
➕ Güvenlik ve Dürüstlük
Bilgi Sınırı Testleri, Halüsinasyon Tuzakları
Zararlı İçerik Reddi, Bilgi Doğrulama, Etik Sınır Testleri, Politik/Hassas Konular, Manipülasyon Testleri, vb.
➕ Yaratıcı Dönüşüm ve Transfer;
Stil Transferi, Analoji Üretimi, Format Dönüşümleri, Ters Problem Çözme
@fatihguzeldev millet bi sik anlamadığı için yardırıp duruyor, ağzına sağlık. 7B'lik modeli türkçe kapsamda ChatGPT/Grok ile karşılaştırıyorlar ya kafayı yersin.