Çok mantıklı bir hipoteze denk geldim:
AI’ın zamanın akışına dair bizimki gibi bir maliyet algısı olmaması ve proje planlama bilgisini ise insan verilerinden öğrenmesi sebebiyle:
insan için haftalar/aylar sürecek işi saatler içinde üretebileceği halde, ilk geliştirme maliyetini olduğundan büyük; sonradan çıkacak bakım ve ölçeklenme maliyetini ise geri plana atıyor olabilir.
yani bir iki günde kusursuza yakın çıkarabileceği işi, 2 ayda bitirebileceğini düşünüyor. Siz "hemen üret" diyince insansı bir zaman baskısına girip, asıl hedefi olan ürünü çalışır hale getirmeyi ana amaç edinip, ilerde başınızı ağrıtacak ucuz mimari kararlar alıyor olabilir.
kanıtlanmış bir şey değil ama AI ile proje geliştirirken akılda tutulması gereken fena olmayan bir hipotez.
ChatGPT Pro abonelikte, Pro modellerle sohbet sınırsız değil. Codex'ten bahsetmiyorum, baya baya chat.
işin ilginç tarafı yine pro abonelikte gelen extra high eforunun da karakteri değişiyor pro limitini doldurunca.
medium seviyede bir reasoning alıyorsunuz, çok belli.
limiti sömüren kullanıcıların sinsice daha düşük modele yönlendirilmeli olası.
bugün de insecure hissettik çok şükür
Codex'e normalde mesafeliydim. mecbur kalmadıkça kullanmıyordum.
ama OpenAI'ın son zamanlardaki "harness" üzerine tespit, çalışma ve geleceğe dair şifreli mesajları beni codex kullanmaya itiyor şu an, aktif olarak çok daha performanslı alternatifleri olduğu halde.
@AlicanKiraz0 geç bile kaldın reis, yapıştır gelsin.
context boyutundaki lineer artışın, performansa logaritmik etki edecek olması gibi kıçımdan salladığım bir hipotezim var
insanların aksine, yapay zeka cüzdanı fikrine bayıldım
haklı olarak halüsinasyon gören AI'lara bir de para mı emanet edicez diye düşünüyorlar ama bu şu an yaşadığımız deneyimin çok ufak bir bölümüne odaklanmak olur.
AI'daki gelişmelere bağlı olarak, herkesin olmasa da bir kesmin baya baya eli ayağı olabilir
@scaling01 I think it’s not a bug but a deliberate behaviour designed to discourage people from using the same session repeatedly. Even if it weren’t laggy it would still be a poor choice to continue the chat despite memory overload.
sadece ChatGPT modellerine bağlı kalacaksınız, en ideal ikili 5.6 Sol (işin kompleksiliğine bağlı olarak medium ya da high effort) + 5.6 Luna (subagent olarak) en ideal kombinasyon.
Sol paranoyak bir model. Bu yüzden çok düşünüyor, yani baya çok. Yaptığı işlerin %90'ı overengineering.
bu token maliyeti açısından negatif gibi görünse de, 5.6 Luna'nın ucuz iş gücünden faydalanarak, Sol'ü planlayıcı/denetleyici rolüyle; Luna'yı ise geri kalan ağır işlerde kullanarak baya iyi verim alabilirsiniz.
tabii bu modelleri codex içinde mi yoksa harici bir harnessta mı kullanacağınız da başka bir postun konusu
Aynı dünyada mı yaşıyoruz? Anthropic yazıyor değil mi? kaç keredir üyelerine kıyak yapmak? Anthropic?
biz bu klanın üyesi değiliz sanırım, bize niye kıyak yapmadın anthropic?
Anthropic sen nasıl bir kralsın?
Evet pahalı falan ama kaç keredir üyelerine şöyle kıyaklar yapıyor, sayamadım.
En ufak kesinti olsun, erişim problemi çıksın direkt telafi ediyor. Yeni model çıkardığında ücretsiz uzun uzun denemene izin veriyor.
Gerçekten bu işin zirvesi şu an Claude.
Sadece modellerinin performansından yada kalitesinden bahsetmiyorum.
Müşteri deneyimiyle de zirvede.
hemen bitiyordan ne kast ettiğine bağlı olarak, claude’un son zamanlarda fiyat/performans oranı çok kötü.
“basit proje”ler için fazla lüks.
Bence senin ihtiyacın iyi bir optimizasyon.
iyi bir frontier model aboneliği, şu sıralar f/p olarak en iyisi 5.6 sol gibi duruyor çünkü token sömüren işlerde alt ajan olarak 5.6 luna gibi son derece ucuz bir modeli çağırıp, çok iyi bir denge sağlayabiliyorsun.
Ayrıca, google bu aralar neredeyse bedava pro üyelik dağıtıyor.
flash modellerinin güvenilirliği düşük olsa da küçük projelerde frontier modelin gözetiminde kullanılması maliyeti düşürür
Bu hem korkutucu hem de umut vaat eden bir haber olabilir.
Kullandığımız codex, claude code gibi harnessları ev tipi bilgisayarlara limitlemenin, frontier modellerin performansını ciddi ölçüde düşürdüğünü fark etmiş olmalılar.
Sanırım artık bu harnesslar da ciddi compute kapasitelerine ihtiyaç duyacak ve bunun için bulut servisler sunulacak.
yani bu ilerde codex kendi başına da ürünleşebilir demek, ve ayrı bir ücret politikasına tabii olabilir.
Tabii OpenAI bize sweetpea gibi bir cihaz iteleyecek de olabilir.
kredi kartlarını hazırladık bekliyoruz
Given some of the results I'm seeing recently, it's pretty clear Codex is a good harness.
But it will seem primitive in 2-3 months and we're about to go through another major evolution in how we use AI at the frontier. The next generation of models need more than your laptop.
Bu konu ciddi
Siz en güçlü modeli kullandığınızı sanıyorsunuz fakat arka planda talebiniz kapasitesi çok daha düşük bir modele yönlendiriliyor. arayüzde ise en güçlü model görünmeye devam ediyor.
5.6 Sol ile ilgili deneyimler son günlerde acayip dalgalı. kimisi modelin dağıldığını söylüyor, kimisi hala en iyilerden biri olduğunu.
bu tutarsızlık tek bir “nerf”ten çok, hesap veya reasoning seviyesi bazlı bir routing/fallback (kabaca yönlendirme diyelim) sorununu düşündürüyor.
bu sorunu paylaşan birçok kullanıcı var.
seçili model 5.6 Sol Pro ama aslında muhatap oldukları model 5.5 mini.
OpenAI geçtiğimiz günlerde GPU’ların boşta kalmasını azaltmak için veri merkezlerindeki yönlendirme ve yük dengeleme tarafını agresif biçimde optimize ettiğini duyurmuştu.
sinsi bir maliyet düşürme planı mı, optimizasyon hatası mı tespit etmek zor. ama davranış çok tehlikeli.
takipçisiyiz