6. Bir şey ters gittiğinde ne olacağı
Bu maddeyi en sona bıraktım, çünkü bir aracın iyi çalışması kadar kötü çalıştığında ne yaptığı da önemli ve bu ikinci kısmı çoğu zaman kimse konuşmuyor.
Üç kapı kurdum. Hepsinde Jev çalışıyor. Bir işte hata aldığımda ilk kapı bana tekrar denemek, beklemek, soruyu değiştirmek ya da sağlayıcıyı değiştirmek seçeneklerinden hangisinin doğru olduğunu söylüyor. Ajan uzun bir işte yoldan çıkmaya başladığında ikinci kapı durduruyor. Ajan geri dönüşü olmayan bir eyleme girdiğinde üçüncü kapı onay istiyor ve ben onay vermeden o iş yapılmıyor.
En önemli tasarım kararı şu: bu üç kapıdan hiçbiri erişilemez olduğunda iş durmuyor. Model cevap veremezse sistem bilinen kurala göre karar verip devam ediyor, çünkü bir kapının hiç olmamasından iyi olan şey, o kapının arızalanması durumunda bile işi kilitlememesi.
Kullanmadığım yerleri de yazayım: gece bakım işlerinin kritik yoluna koymadım, çünkü orada tek arıza noktası istemiyorum. Hukuki metnin içeriğini elemeye koydurmuyorum, çünkü yanlış eleme geri dönüşsüz. İki günlük kayıtta üç yüz kırk bir çağrı yapmışım ve toplam on üç sent ödemişim.
Jev'i Hermes Agent üzerinde AI hukuk iş akışlarımda nasıl kullandığımı anlatacağım. Numaralı gideceğim, çünkü her maddede ne kazandığımı, neye bedel olduğunu ve nerede sınırı bulunduğunu ayrı ayrı yazmak istiyorum.
1. Arşiv araması
Bu işin çıkış noktası kendi arşivimde kendi yazdığım dilekçeyi bulamamam oldu. Bunun sebebi standart arama motorunun kelimeye bakması, benim aradığım şeyin ise anlam olmasıydı. Bir davada kullandığım cümlenin hangi dosyada geçtiğini hatırlıyorum ama o cümledeki kelimeleri hatırlamıyorum, dolayısıyla arama boş dönüyor ve ben aradığım belgeyi sıfırdan yazmak zorunda kalıyordum.
Şimdi Hermes 10.000+ dilekçe arasından önce kelime ve anlam üzerinden bir aday listesi çıkarıyor, sonra o listeyi Jev'in önüne koyuyorum ve adayların içinden benim işime yarayacak olanları üste alıyor. Bana yalnızca sıralamayı vermiyor, o sırayı neden kurduğunu da yazıyor, böylece listeye körü körüne güvenmek zorunda kalmıyorum.
Ölçtüm: kırk beş sorguluk bir kontrol listesinde doğru belgeyi ilk beş sıraya sokma oranı yüzde otuz sekizden yüzde yetmiş beşe çıktı.
5. Kendi kalıbımdan sapmayı yakalamak
Bir dava türünde yıllardır aynı iskeleti kullanırım, yeni bir dosyada bu iskeletten çıktığımda genellikle farkında olmuyorum, çünkü sebep gayet açık, dosyanın esası farklı olduğu için kalıp kendiliğinden değişiyor.
Bunu Mac'te taratıyordum ancak tarama tek başına işe yaramıyor, çünkü seçili kural dışı cümlelerin bir kısmı gerçekten savrulma, bir kısmı ise dava türünün gereği oluyor. İkisini ayırmak için Jev'e soruyorum ve o, "bu sapma mı, yoksa bu dosyada olması gereken bir anlatım mı" ayrımını yapıyor.
Ölçtüğümde bir buçuk saniye sürdü ve maliyeti kuruşun altında kaldı. Asıl kazanç ölçümde değil: kendi üslubumun nerede bilinçli olarak değiştiğini ilk kez yazılı görmeye başladım, çünkü insanın kendi kalıbını dışarıdan görmesi zor ve kalıp zaten onun düşünme biçimi. +
Bir dilekçe oluşturmadan önce 10.000 tane eski dilekçemi FAISS + RAG ile tarayıp, işe yarayacak savunmaları bulan ve ekleyen bir dilekçe motorum vardı, sistemi jev’e devredip 100 tur test ettim. Nihayetinde çıkan sonuç gelenekselden daha iyiydi, 1 cent bile tutmadı, daha hızlıydı ayrıca.
Okumuyorsun işte. "Cevabı onaylamıyorum ama saçmalık soruya böyle bir cevap verebilir" demişim özellikle zaten. Boşuna yoruyorsun beni. Bir de savunmaktan gözlerin kararmış olabilir diyorsun :P Kendi gözlerine baktır Bilal.
@Bilaltas9@58fatihsezer@eczozgurozel Ne alaka Bilal? İstediğin şey hakkında hesap sormasını istemek başka, istediğin şeyin neden olmadığını sormak başka şey. Özel gayet de 3600 ek göstergeyi söyledi, hesap sordu. Uygulamayan hükümettir. Gidip ona söyleyeceksin. Erdoğan'ın her şeyden sıyrılmasından bıktım.
@utkusen Sosyolojik bir konu bu. Amerika’da değil dünyada etkili bir muhalefet yok. Bence artık hayatta haz alabileceğin çok imkan olmasıyla alakalı. Kimse eskisi kadar sorunlarını dile getirip kendini riske atmıyor. Topluluk olup organize şekilde hareket etmekten bahsetmiyorum bile.
Kesinlikle bir fark olur. Ancak kazanç için değerlendiriyorsak hep çok önemli bir noktayı kaçırıyoruz. Hep hizmet vereni konuşurken hizmet alanı konuşmuyoruz. Alıcı çoğunlukla sıradan vatandaş, sıradan vatandaş ise kesinlikle AI konusunda çok bilgisiz. AI iş akışlarını yaratan kitle %1, dolayısıyla "emek azaldı" diyebilecek ancak %1 var. Halk halen AI ve AI ile yaratılabileceklerden son derece habersiz. Dolayısıyla en azından TR'de uzun süre (7-8 yıl) sektör gelir oranlarının değişeceğini zannetmiyorum. AI yüzünden çok daha az kazanan sektör olacaktır ama bu sayı bence çok az olacaktır. Ancak tabii nihayetinde sonuç belli, oraya varacağız.
@haskologlu Bu hangi suç oluyor ben bilmiyorum. Başka alıcılara baskı varsa tabii suç ama bu baskı nasıl yapılıyor hiçbir detay yok. Kendilerinden başkalarına güç zoruyla mı sattırmıyorlar? O yüzden haber detaylarıyla değerlendirdiğimde, suç ne ben göremedim.
Bir hukuk bürosunda ise düşüncelerime göre zincir şu sırayla kurulabilir:
Belge okuma ve çıkarım multimodel LLM'de;
Sınıflandırma, risk, uygunluk ve tutarlılık kararı Jev'de;
Hangi eylemin onaya bağlı olduğunu söyleyen kapı sıradan kodda;
İnsan onayı yalnız düşük güvenli, yüksek riskli kararda;
Metnin yazılması multimodel LLM, işler bitince en sonunda da arşiv kaydı var.
Bu sistemle tekrar etmeyen kararlarda dahi inanılmaz bir verimlilik artışı, maliyet düşüşü elde edebilirsiniz. Tekrarlanan kararlarda ise çok düşmüş maliyetin daha da düşmesi, zaten çok hızlanmış sürecinizin daha da hızlı sonuca varması, neredeyse hemen ve bedava gibi bir noktaya yaklaşacaktır. Ayrıca denetim her adımda çalıştığı için hata yakalama işin sonuna ertelenmiyor, hangi kararın hangi güvenle verildiği kayda geçtiği için dosyada savunulabilir bir iz oluşuyor. Açıkçası AI iş akışlarıma Jev entegrasyonu sağlamayı düşünüyorum.
TypeSafe AI, System One adını verdiği yeni model sınıfının ilk üyesi Jev'i erken erişime açtı, duyurunun en dikkat çekici yanı ise modelin metin üretmemesi oldu. Jev girdi olarak bir durumu (state) alıyor, çıktı olarak tipli kararları kalibre edilmiş olasılıklarla birlikte döndürüyor. Kısacası kararlar alarak sonuca ulaşıyor. LLM'ler ile kıysalandığında, ayrım dört başlıkta toplanıyor.
Birincisi üretim mimarisi, bildiğimiz dil modelleri otoregresif çalışıyor, yani belirteçleri sırayla üretiyor. Jev ise paralel örnekleme yapıyor ve istekteki soruları tek geçişte değerlendiriyor. Üç soru sormakla otuz soru sormak arasındaki gecikme farkı neredeyse yok, ek soruların bedeli yalnızca belirteç maliyeti olarak yansıyor. İkincisi eğitim yöntemi, Jev RLCD yöntemiyle, beyan edilen olasılıkla gerçekleşen isabetin örtüşmesini optimize ediyor, dolayısıyla kalibrasyon sonradan eklenen bir komut olmaktan çıkıp eğitimin doğal çıktısı hâline geliyor. Üçüncüsü çıktı, serbest metin üretip ayrıştırmaya mecbur kalan yığın, yerini şema düzeyinde bağlı tipli değerlere bırakıyor. Dördüncüsü güven davranışı, LLM'ler aşırı özgüvenli, tutarsız bir güven tonu üretirken Jev her çıktının yanına kalibre edilmiş güven değeri koyuyor.
Üç soru tipinin birlikte kullanımı tek örnekte belirteceksek; bir destek talebini seçim (choice) sorusuyla faturalama, talebi teknik veya satış sınıflarından birine yerleştirmek, aynı istekte puan (score) sorusuyla aciliyeti 0-100 arasında biçmek, evet-hayır (noul) sorusuyla müşterinin geri dönüş bekleyip beklemediğini sormak mümkün. +
Harness, bir "modelin" etrafında onu çalıştıran yürütme katmanına verilen addır; araç çağrıları, bağlam yönetimi, durum takibi, denetim ve eskalasyon kararları bu katmanın içinde yaşar. Bugün Harness aracılığıyla LLM kullanarak yapılan iş akışlarında yazıyı üreten model aynı zamanda kararı da veriyor, dolayısıyla kararın bedeli yazının bedeline eşitleniyor.
Jev ile LLM kullanılabilecek bir Harness'ta ise ayrık mimari bunun karşısına net bir iş bölümü koyuyor. Kararı Jev, politikayı sıradan kod, kelimeleri LLM üretebilir. Bu haliyle hem çok daha ucuz, çok daha hızlı, çok daha başarılı ve güvenilir çıktılar üretilebilir!