@0xcyberatlas Dostum ben LLM researcheriyim. LLM'ler next token predictiondan ibaret bu bana verilmiş bir bilgi değil gelen tüm paperları okuyarak konuşuyorum. Emergent capabilities zaten kolay anlaşılacak bir davranış değil, ama olay zaten bunun next-token prediction yaparak ortaya çıkması :D
@0xcyberatlas Ayrıca
"Örneğin Hugging Face saldırısında neden 1200 ajanın 700'ü saldırıya katılırken 500'ü katılmayı reddetti?"
Aynı safety benchmarkını aynı modelle runlarsan aynı accuracy'e ulaşmazsın. LLM'ler probabilistictir ki gücü buradan geliyor. (tabi ki daha derin sebepleri vardır)
@0xcyberatlas Tabi ki bunlar benim fikirlerim ve deneyimim ki tek bir fikir yoktur, benim karsı geldiğim şey LLM'leri düşündüğünden daha çok biliyoruz ve düşündüğünden daha kolay modellemeler (Attention dediğin şey inductive biası yok, yani fazla data ver öğren şeklinde tamamen)
@KndisiOlmayan@0xcyberatlas Greedy decode yapmıyorsan vermez. Her adım bir p(t) distributinou veriyor sen bundan samplelıyorsun .Temperature 0 olsa bile backend ve reasoningden kaynaklı modeller artık cok deterministic olmuyor isterseniz bunu deneyebilirsiniz reasoning modelleri ile
@MertSusur Birazcık araştırıp adamın GPT-4o system cardında oldugunu bulmak cok zor olmamalı. Anthropic ve OpenAI yediği bokları bilmek için içeriden de çalışılmasına gerek yok. Birisini tweet sayısına göre mi yargılıyorsun gerçekten
@0xcyberatlas@Avenoxai Ayrıca Neural Network ve Görüntü işleme da sadece fonksiyon öğrenmek - her nasıl LM'lerde p(x_t | x_t+1<) öğrenyirsan, bunda da image distribution ve labellarını öğrenyiorsun. Tamamen datadaki sinyalleri işleme üzerine kurulu yani burada yanlış bir yorum yok
@0xcyberatlas@Avenoxai bunun LLM'lerin next-token predictiondan ibaret oldugu gerçeğini değiştirmiyor farkedersen. Matematik dediğin şey kural zinciri, küçük şeyleri kanıtlayarak büyük şeylere gidersin. LLM de zaten tam bunlarda iyi olacak sistemler. AGI tamamen yarı bir kavram
@ab11216174@Youssofal_ Entire reason LLMs have blown up is due to the language capabilities, agentic flow is something that can be always added in post-training. If your model doesnt understand the language that you want it to use as a chatbot, then adding capabilities is meaningless.
@Avenoxai DeepSeek, Qwen ve Kimi sağolsun yayınladıkları tüm architectureları herkes hemen adapte ediyor (kimi delta attention, DeepSeek ve Qwenin mixture of expertsi düzgün scale etmesi vs)
@AlicanKiraz0@huggingface Yani modeller açık kaynak olduğu sürece (ki destekliyorum) tek bir steeringe bakıyor bunları uncensored yapmak (ne kadar zorlaştırsalar da). Yani bu yolu kesmek biraz zor değil mi hocam
@eeebektas Bu küçük ihtimal olduğu sürece (ki olmasa bile) AI sadece doktorun kullanacağı, ikinci bir düşünce alacağı, belki belirli testleri analiz edip edge-case bulacağı bir tool olacak ki doktorların yaptığı hata oranı düşsün.
@eeebektas TUSda 100 alması ya da matematik olimpiyatında çok iyi olması bir şey ifade etmiyor. Sen gidip yazdığı ispatı anlayamıyorsan kabul edebileceğin bir şey de yok ortada ki en iyi modeller bile hala hallucinate ediyor o kadar tool calling yapsalar bile bu çözülmüş bir şey değil