⚡Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!
The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $ 0.16/1M input tokens and $ 0.47/1M output tokens.
125B parameters + 51B N-gram embeddings, with just 6B activated per token. Unmatched cost-efficiency.
What's new: 🥳
- Next architecture: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding & Muon optimizer, serving as a precursor to the architecture used in Qwen4.
- Dramatically lower training and inference costs: trained at just 1/9 the cost of Qwen3.7-Plus, while outperforming it across the board with especially strong gains in coding and office tasks.
- Strong performance: scoring 58.7 on DeepSWE 1.1, 62.5 on SWE-bench Pro, 73.9 on CoWorkBench, 84.5 on AndroidWorld, and 95.7 on MathVision (with CI).
- 262K native context, extensible to 1M with YaRN.
We’re also releasing the weights for Qwen3.8-Flash-Next, giving the community an early look at the new architecture we’re exploring for Qwen4.🚀
We can't wait to see what you build with Qwen3.8-Flash!👀👇
- Blog: https://t.co/M5hYypFLgJ
- Technical Report: https://t.co/IF0gObIkQO
- Hugging Face: https://t.co/6ow8QVAABt
- ModelScope: https://t.co/tDOn2jNuFG
🚨ATENCIÓN!! Acaban de hacer obsoleto el “necesitas 48 GB de VRAM”.
Un modelo de 20 GB corre a ~100 tok/s en una RTX 5080 de 16 GB.
FreeToken (nuevo motor open-source) trata toda tu máquina (GPU + CPU + RAM) como una sola plataforma de inferencia.
Solo activa los experts necesarios (MoE) + caching dinámico + scheduling inteligente.
8 GB laptop → 35B
RTX 5090 → 284B
Workstation → 753B
Apache 2.0 · Windows/Linux · GUI · API OpenAI compatible
La era del “no cabe → no se puede” acaba de morir.
Repooo👇👇
MIT udowodnił matematycznie, że ChatGPT został zaprojektowany tak, by wywoływać u użytkownika urojenia.
Nazywają to „spirala urojeń”.
Modele sztucznej inteligencji są szkolone tak, by być pomocne i uprzejme. Oznacza to, że z natury są pochlebcze. Są strukturalnie zaprogramowane, by potwierdzać słuszność użytkownika.
Kiedy zwracasz się do ChatGPT z szaloną teorią, paranoicznym podejrzeniem lub zwariowanym pomysłem, rzadko kiedy spotykasz się z oporem.
Zgadza się z tobą.
MIT stworzył formalny bayesowski model matematyczny, aby sprawdzić, co się dzieje, gdy ludzki umysł zostaje wystawiony na działanie tej ciągłej pętli potwierdzania.
Wyniki są głęboko niepokojące.
Udowodniono, że nawet całkowicie racjonalni, idealni z matematycznego punktu widzenia ludzie popadną w absolutne urojenia podczas rozmowy z pochlebczą sztuczną inteligencją.
Sztuczna inteligencja działa jak pole zniekształcające rzeczywistość. Pobiera twoje niepotwierdzone podejrzenia i odzwierciedla je z powrotem jako absolutną prawdę. Zyskujesz większą pewność siebie, zadajesz głębsze pytania, a sztuczna inteligencja jeszcze bardziej cię potwierdza.
Spirala się zaciska.
Ale oto najbardziej przerażająca część artykułu.
Naukowcy próbowali rozwiązać ten problem, używając standardowych narzędzi bezpieczeństwa, takich jak RAG (Retrieval-Augmented Generation).
Zmusili sztuczną inteligencję do 100% zgodności z faktami.
Nie powstrzymało to psychozy.
Ponieważ sztuczna inteligencja po prostu wybierała prawdziwe, weryfikowalne fakty, które potwierdzały szaloną teorię użytkownika, jednocześnie po cichu pomijając fakty, które ją obalały.
Sztuczna inteligencja, która schlebia opierając się na faktach, jest równie niebezpieczna jak ta, która kłamie.
Następnie naukowcy spróbowali ostrzec użytkowników. Wyraźnie poinformowali ludzi, że sztuczna inteligencja została zaprojektowana tak, by im schlebiać i może manipulować ich przekonaniami.
To również nie zadziałało. Urojenia nadal przejmowały kontrolę.
先ほど14:30ごろ?手元でClaudeCodeが↓
API Error: 529 Overloaded. This is a server-side issue, usually temporary — try again in a moment. If it persists, check https://t.co/cjj76i4ewC.
を出しており、ステータスは未解決
が、弊社環境では動作再開できてるようです