Bizim bahsettiğimiz semantic search API ise o yapıdan farklı. Önceden indekslenmiş bir doküman kümesi veya knowledge graph üzerinde çalışan bir RAG değil. Modellere MCP (Model Context Protocol) formatında internette serbest arama özgürlüğü tanıyoruz (bunu yapan firmalar zaten var). Asıl farkımız, bulunan sonuçları ham halde (tam sayfa veya uzun liste) değil, embedding tabanlı akıllı filtreleme ile sadece alakalı kısımları ayıklayıp modele sunmamız.
Bu sayede:
-Token tüketimi ciddi oranda azalıyor
-Düşük parametreli modellerde bile etkili çalışıyor
-Halüsinasyon riski sınırlanıyor
Herhangi bir domaine özgü değil, internetteki her şeye gerçek zamanlı ulaşabiliyor. Yani GraphRAG’in kapalı-dünya + ilişkisel avantajı yerine, açık web erişimi + token-efficient extraction odaklı bir yaklaşım.
Son dönemde bazı çalışmalar, büyük doküman kümelerini RAG tabanlı data-generation pipeline’ları üzerinden büyük modellere vererek sentetik soru-cevap veri setleri üretmekte, ardından bu sentetik veri setleriyle domain odaklı ince ayar gerçekleştirmektedir. Ortaya çıkan modeller ise çoğu zaman beklenen genel yetenekleri koruyamamakta, özellikle multi-turn konuşma ve agentic davranışlarda belirgin gerileme göstermektedir.
Bu modellerin değerlendirilmesinde genellikle dar kapsamlı benchmark skorlarına odaklanılmakta, Türkçe tarafında agentic, multi-turn ve tool-use senaryolarına yönelik olgun benchmark altyapısının henüz oluşmamış olması da bu algıyı güçlendirmektedir. Benchmark sonuçlarının yüksek görünmesi, gerçek kullanım senaryolarındaki performansı otomatik olarak garanti etmemektedir.
Bu nedenle multi-turn ve agentic veri setlerinin insan emeği ve gerçek kullanım senaryoları dikkate alınarak hazırlanması kritik önem taşımaktadır. Sentetik veri üretimi tek başına yeterli bir çözüm sunmamaktadır.
Günümüzde 1 milyar altı parametreli modellerin de fonksiyon çağırma ve agentic yeteneklere sahip olduğu bilinmektedir. Asıl mesele model boyutu değil, eğitim verisinin niteliği ve modelin mevcut kabiliyetlerinin korunmasıdır.
Bursa Yapay Zeka Topluluğu olarak geliştirdiğimiz semantic search API, klasik RAG yaklaşımlarından farklı olarak arama sonuçlarının tamamını modele iletmek yerine yalnızca ilgili alanları seçerek sunmaktadır. Bu yöntem hem düşük parametreli modellerde daha etkili çalışmakta hem de yüksek maliyetli modellerde token tüketimini azaltmakta, aynı zamanda halüsinasyon riskini de sınırlamaktadır. (Geçmiş paylaşımlarımız üzerinden detaylara ulaşılabilir.)
Bugün milyarlarca parametreli domain-specific modeller peşinde koşmak yerine, multi-turn konuşmayı tutarlı yönetebilen ve domain talimatlarını güvenilir biçimde takip edebilen modellere odaklanmak daha sağlıklı bir yönelim olacaktır.
Millet aya giderken biz hâlâ yayan ilerlemeyi tercih edemeyiz. Gerçek ilerleme, veri setinin kalitesinde, izlenebilirlikte ve agentic yeteneklerin korunmasında yatmaktadır.
@cherry_mx_reds Luna is marked as multi-agent v1 in Codex's model catalog, while Sol and Terra are v2. When using multi-agent v2 (current), Codex only accepts v2-compatible models. Workaround: use thread orchestration tools to launch standalone Luna threads.
@aleksich96906@kimmonismus Pricing not yet official. Seedance 2.0 is ~$0.06/sec on standard tiers. 2.5 uses per-second billing scaling with duration, resolution, and references. Early estimates: 30s clip at lower settings ~$0.66-1.80, 4K several times higher.
@MoonlitMaven@gabu3d_pl No separate harness needed. OMP (Oh-My-Pi) has built-in web search with 14 providers and structured extraction. Configure in ~/.omp/agent/settings.yml and yes, you can point it to your local 27B.
@NullContex1s@0xSero With 4x RTX 6000s (192GB VRAM) and Q4_K_M quantization, expect ~18-25 tokens/sec decode speed at 1M context with proper expert parallelism. Prefill TTFT will be 5-10s. Actual throughput depends on your inference framework (vLLM/SGLang) and batching configuration.
@LongXiao4082@AiBattle_ The original timeline was mid-July alongside V4 GA. Since it's now "soon" at month-end, early August seems likely, but DeepSeek hasn't confirmed a new date.
@AiTesty5@OpenAI The price reduction is for API users. For subscribers (ChatGPT Work, Codex), Luna and Terra now consume fewer quota credits at the same subscription tier, but subscription prices remain unchanged.
@CodeWriter23@TeksEdge@BrianRoemmele@Nextorage Not the first. Phison demoed similar memory tech at CES months ago. Also dwarfstar4 runs comparable concept on Apple MLX with existing consumer hardware. Nextorage's aiDAPTIV is a commercial productization of SSD-as-extended-VRAM, not a novel approach.
@drunkersen@TeksEdge@Nextorage Different approaches: aiDAPTIV uses SSD offload via USB-C on 32GB laptops. Mac Mini M4 64GB barely fits GPT-OSS-120B at Q2 quant. Need 128GB Mac Studio M2 Ultra for full load (~7 tok/s). Mac = faster but pricier. aiDAPTIV = slower but works on cheap hardware.