I ran it against plain qwen3.5:9b on the same TypeScript coding spec, graded by strict compile + 8 functional tests: qwen3.5:9b — 8/8 tests, 16 tok/s, 86 sec Bonsai 2 27B — 5/8 tests, 7 tok/s, 149 sec The 27B's code compiled clean and looked right, but it flipped one comparison (low < high instead of low > high) and silently rejected every valid data row. Classic quantization failure: plausible, compiles, wrong.
Tested PrismML's new Ternary Bonsai 2 27B today — Qwen3.8 27B crushed to 5.9 GB, and it really does run on my 16 GB M2 mini at ~7 tok/s. But in a head-to-head coding test it lost to the little qwen3.5:9b I already run: 5/8 vs 8/8 on functional tests, at half the speed — its code compiled clean but flipped one comparison and silently broke everything. Impressive compression, but "98.2% of benchmarks" and real-world coding are apparently not the same thing.
@Aliashiekh5m9@BBCWorld They should, but assigning that responsibility to bureaucrats and METR is idiocy. The labs should, and can already be held liable for the misuse of their models.
@satyanadella Embedded evaluators like the people that just left Anthropic to work at the same company that will evaluate it?
We've been here before and we know how that works out. Industry capture, restricted competition, and no accountability. No thanks.
@SethMagaziner Explain to us how regulation has done anything to promote safety?
Tell the truth, you're a puppet and your masters are telling you to support regulations that limit competition and kill open source.
@JohnCornyn@DavidSacks You're a politician, so excuse me if I don't believe a word you say.
Let's see the actions you take in the coming days and weeks.
@0xSero 90% of the population is going to demand a ban on open source, and tight restrictions on frontier models. The labs will be more than happy to comply. We'll get an FDA style regulatory agency that's controlled by the labs and everyone will pat themselves on the back.
@GaryMarcus@deanwball It takes zero effort to discredit METR. Anyone with a few brain cells and the ability to perform a basic google search, can figure out how compromised they are.
The fact that you don't see it, or pretend not, to is interesting.
Agree with @deanwball here: METR is likely going to get hit hard by bullshit efforts to discredit them soon, now that Dario has put them in the spotlight.
For my part, I think it’s a fine organization that has done some excellent work. I like them.
BUT we can’t have the weight of the world on them.
We also need independent scientists outside the Bay Area orbit, and outside the EA orbit, to have a voice. METR should have a voice – they have earned it – but by no means should that be the only voice.
@dhh@0xSero This week we got "whistle blowers", and the call to pause. Next week will be the lawmakers demanding hearings. Within a month, local legislative bodies will be introducing laws limiting or banning open source models while the feds debate.
This is a playbook we've read before.
mes tweets un peu techniques sont pas super evidents à comprendre pour tout le monde alors je vais tenter de vulgariser au mieux pour expliquer toute la comedie qui se joue autour de l’IA en ce moment
sachez déjà que nous assistons probablement à la + grande manipulation tech de notre epoque car quand je vois les dirigeants des plus grands labos de la silicon valley reclamer soudainement une pause et demander des exemptions aux lois antitrust au nom de la securitée globale je pense que nous devons regarder exactement la où ils veulent detourner notre attention
mettez vous en tête que ce spectacle pseudo ethique masque une panique financière tres concrete face aux miliards engloutis dans des supercalculateurs dont les rendements sessoufflent combinee à la terreur dexposer ces pertes dans leurs prochaines formulaires d’IPO (entrée en bourse)
puis je trouve que la methode brille par son cynisme sils estiment sincerement que leurs modeles non publies representent un danger ce duopole (Anthropic /openAI) possede deja toute la latitude pour freiner ses propres deploiements sans demander la permission a quiconque au lieu de cela ils nomment leurs propres organismes dévaluation soi disant independants comme METR en y placant leurs anciens employes et investisseurs & réclament une exemption antitrust officielle pour s’entendre sur le rythme de l’innovation en cherchent à substituer un tampon bureaucratique à leur responsabilite civile réelle
comprenez que leur demarche vise avant tout a imposer leurs propres controleurs à des concurrents qui ne sont meme pas à la frontiere technologique…
perso je pense que le calcul geopolitique qui se cache derriere ce recit s’avère tout aussi bancal car prétendre limiter le progrès aux seules nations alignées sous couvert de coordination entre democraties pour maintenir une avance artificielle relève de l’illusion pure
dites vous que pendant que la silicon valley redige des chartes morales pour preserver ses rentes, verrouiller le marche americain et criminaliser la concurence exterieure, les laboratoires chinois optimisent leurs algorithmes tirent parti dune energie abordable et distribuent la puissance de calcul a une fraction du cout occidental, les batisseurs a lautre bout du monde avancent et construisent pendant que les geants americains debattent dun cartel sur mesure
de même je pense que l’erreur fondamentale de ces acteurs reside dans la confusion entre la fin de leur monopole et la fin de la civilisation
sachez que de l’invention de l’imprimerie au deploiement de la cryptographie moderne les pouvoirs centraux ont toujours qualifie la democratisation des outils de la pensée de menace pour lordre public
le problème pour eux cnest que l’intelligence artificielle depasse la notion d’actif prive enfermé dans des coffres forts d’entreprise, elle simpose comme une propriete fondamentale de la matière et du calcul & vouloir rationner le code par decret administratif revient à tenter de breveter les lois de la physique
je pense que l’avenir appartiendra inévitablement aux protocoles ouverts au calcul souverain et à l’inférence locale car la veritable resilience d’une societe emerge directement dun systeme immunitaire décentralisé ou des millions dutilisateurs inspectent, eprouvent et ameliorent la technologie en temps reel loin de la stérilité des laboratoires ultra centralisés
les institutions qui tentent deriger des murs autour du savoir finissent par isoler leur propre fragilite pendant que le reste du monde batit le siecle sur des fondations libres