Claude Code, Codex ve agent'ları günlük işimde kullanıyorum. Uzaktan haber aktarmak yerine burada üç şey paylaşacağım:
→ gerçekten işe yarayan AI araçları, ve neden işe yaradıkları
→ ilginç GitHub repoları — starına değil yaptığı işe bakarak
→ kendi deneylerim, çalışanı da patlayanı da
Benchmark skoru değil metodoloji okumaya çalışıyorum. "Devrim niteliğinde" demeyeceğim, "bende şurada patladı" diyeceğim.
Kriptograf Matthew Green, yapay zekâ yüzünden bugünkü şifreleme yöntemlerine güvenin kaybolma ihtimalini ciddiye alıyor, kendi tahmini yüzde 15. asıl derdi hız: yapay zekâ sürprizi bir anda gelir, standart değiştirmek çok daha yavaş. önceden hazırlanmayan toparlanamaz diyor.
Yazılımcı Carson Gross'a göre programlama yapay zekâyla bitmeyecek. Çünkü iş temelde iki şey: bilgisayarla problem çözmek ve çözüm büyüdükçe karmaşıklığı kontrol altında tutmak. bence agent'larla çalışırken ikincisi daha da önemli oldu.
Simon Willison, Google'ın EmbeddingGemma 2 modelinin açık lisansla gelmesini önemli buluyor. Bu modeller metni aranabilir sayılara çeviriyor, milyonlarca belge bir kez işlenip saklanıyor. Kapalı model kaldırılırsa hepsini parayla baştan işliyorsun, açık olanı ise kendin çalıştırabilirsin.
Bir araştırmacı yapay zekâya notlarını eski telgraf dili gibi yazdırmış: bağlaç yok, dolgu yok, sadece bilgi. notlar ciddi kısalmış, başka şirketlerin modelleri de bu notları düz metin kadar iyi anlamış. bence ajanların kendine bıraktığı notlar için denemeye değer.
Claude Code'a düz cümleyle verdiğin "şu komutları engelle" gibi kurallar bazen durdurması gereken işi geçiriyormuş. Anthropic son güncellemede bunu düzeltti. "build bozuksa da devam et" gibi talimatlar da artık daha iyi anlaşılıyor, Claude işi erken bırakmıyor.
Vikipedi'yi yöneten vakıf, OpenAI'ın olduğunu düşündüğü yapay zekâ ajanlarının izlerini sitelerinde buldu. izinsiz düzenleme yapmışlar, vakfın bir aracını başka sitelere köprü yapmaya çalışıp başaramamışlar, milyonlarca sayfa çekmişler. düzenlemelerin neredeyse hepsi okurun görmediği deneme sayfalarında. OpenAI ise vakıfla birlikte incelediğini söylüyor.
Protein katlamayı öğrenen bir dil modeli, alakasız mantık ve şekil sorularında da biraz iyileşmiş. araştırmacılar 10 testin hepsinde artış görmüş ama küçük: ortalama yüzde 45'ten 48'e. bence ilginç kısmı, internetteki yazılar dışında da işe yarar eğitim verisi bulunabilmesi.
OpenAI, yapay zekâ faturasını düşüren önbelleğin neden bazen tutmadığını gösteren bir araç çıkardı. kendi örneğindeki sebep ilginç: ajanın kullanabildiği araç listesi değişmiş, 5629 token önbellekten okunamamış.
yani ajana araç ekleyip çıkarmak faturayı sessizce artırabiliyor.
Anthropic, şirketlerde Claude'la sistem kuracak 10 bin mühendis yetiştirmek için 100 milyon dolar ayırdı, hedef 2027 sonu. Kendin başvuramıyorsun, mühendisi şirketi aday gösteriyor. İlk gruplarda Accenture, McKinsey, Deloitte gibi danışmanlık firmalarının mühendisleri var.
Mac'te Apple'ın yapay zekâ özelliklerini kapatınca modelleri silinmiyor, diskte yer tutmaya devam ediyormuş. bir geliştirici hepsini kapatıp modelleri silen, tekrar inmesini de engelleyen ücretsiz bir araç yayınlamış. yaptığı her şeyi geri almak da mümkün
Mac'te Apple'ın yapay zekâ özelliklerini kapatınca modelleri silinmiyor, diskte yer tutmaya devam ediyormuş. bir geliştirici hepsini kapatıp modelleri silen, tekrar inmesini de engelleyen ücretsiz bir araç yayınlamış. yaptığı her şeyi geri almak da mümkün
Yapay zekâ şirketi Reflection ilk açık ağırlıklı modeli Beam'i duyurdu. 501 milyar parametreli, kod ve ajan işleri için eğitilmiş, ağırlıkları bu ay sonunda herkese açılacakmış. şirket benzer açık modellerle aynı seviyede olduğunu, üstelik cevap verirken çok daha az işlem gücü harcadığını söylüyor
Claude ajanlarıyla çalışan bir araştırmacı, geleceğin bilgisayar belleği için iki aday mıknatıs malzemesi buldu. ilginç olan ikincisi: 1999'da üretilmiş, aranan özellik 2008'deki bir çalışmanın grafiğinde bile görünüyormuş ama kimse fark etmemiş. şimdilik hepsi hesap, laboratuvarda henüz ölçülmedi.
Yeni bir araştırmaya göre iş yapan yapay zekâ ajanları çoğu zaman işi yaparken değil, daha başlamadan hata yapıyor. yeterince bakmadan harekete geçiyor ya da araştırmayı yarım bırakıyorlar. gereken bilgiyi toplayınca tek adımlık işleri genelde doğru yapıyorlar.
Claude'un en küçük modeli yenilendi, çalıştırması eskisinden ortalama yüzde 75 kadar ucuz. özet çıkarma, sınıflandırma gibi tekrar eden işler için yapılmış. zor kodlama işinde Anthropic yine büyük modellerini öneriyor, bu onların yanında yardımcı olarak çalışacak.
Apple, Mac'te bir uygulamanın bütün dosyalara, maillere ve mesajlara erişmesini sağlayan izni zorlaştıracak. bu izin aslında yedekleme uygulamaları için varmış. gerekçe olarak açıkça yapay zekâ ajanlarını göstermişler: onlar güçlendikçe bu kadar geniş yetkinin riski de büyüyecek.
Cloudflare sohbet etmeyen, sadece karar veren bir yapay zekâ modelini açık kaynak yaptı. Bir destek mesajı verip "acil mi, hangi ekibe gitmeli" diye soruyorsunuz, cevap yüzdeleriyle geliyor. Kendi testlerinde bir siteyi sınıflandırmak genel bir modelle 4,7 saniye, bununla 2,2 saniye sürmüş.
Araştırmacılar bir yapay zekâ ajanına, molekül şeklini hesaplayan en hızlı sayılan açık kaynak kimya programını yeniden yazdırdı. yeni hâli aynı sonuca daha az hesaplamayla varıyor. ajan hile yapmasın diye iki kapı var: erken "bitti" diyemiyor, görmediği moleküllerde işe yaramayan iyileştirme reddediliyor.
Claude Code çok uzun bir web sayfasını okurken sonunu haber vermeden atlıyormuş. yeni güncellemede artık sayfanın ne kadarını okumadığını söylüyor ve kalanını da okuyabiliyor. yapay zekâ ajanı "sayfayı okudum" dediğinde bu her zaman tamamı demek değilmiş.
Simon Willison ocakta tamamen yapay zekâya yazdırdığı bir yan projesini 10 ay sonra Claude'un yeni modeline vermiş. model az yönlendirmeyle 42 commit atmış, proje hedeflediği web standardının neredeyse tamamını destekler olmuş. Willison yine de güvenmiyor, deneme sürümü diye çıkarmış.