We can finally talk about it:
We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.
We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried.
the focus on whether you read the code or not is the wrong thing to look at
if you have software you're responsible for, you should be able to answer questions from memory about how it works
the expectations for how well you can do this should not be any different now
@VincentVentalon@elboanas Ce que tu oublies quand même c'est la formation pour comprendre ce que l'IA et ce qu'est un agent, comment ça fonctionne et pouvoir répondre aux questions que le client pose quand on est en régie et qui ne sont jamais des questions triviales
Le pb d'agents comme Hermes c'est la promesse derrière, les PME s'attendent qu'un agent fasse tt et soit parfait car c'est de "l'IA". En réalité ce genre de déploiement demande de la communication et bcp de vulgarisation pour que ce soit accepté et que ça crée pas un client déçu
Vendre des agents Hermes pour difficilement 5k par mois
Alors que vous pourriez apprendre à faire des agents sur GCP et faire de la régie pour 12-20k par mois
🙃
@RayaneRachid_ Intéressant sur le papier et dans leur résultats à eux, ça change pas mal de choses de ce qu'on connait actuellement, mais j'attends d'autres tests indépendants, on a vu trop de overfitting et de promesses non tenues
@minosdevs T'es sur bing webmaster, c'est pas vraiment une citation provenant de chatgpt, puis 150 citation ça n'a pas beaucoup de valeur. Quelles urls ont ete cités, combien de clics, cb de conversion... Courage en tout cas !!
@meaxthegoodkid Le problème avec ce genre de chaise c'est quand tu dois travailler ailleur que chez toi, t'es dégoûté de ne pas retrouver le même confort 😅
Un jour, il faudrait que je vous raconte la fois où j’étais dans un call il y a quelques temps avec les représentants d’un « conseil de l’IA » public, au niveau France / Europe, et où les « président / responsables IA » n’avaient aucune idée de ce qu’était un « gradient ».
Je leur ai juste demandé : « Comment faire appliquer concrétement les mesures d’audit des modèles d’IA ? On ne va pas aller fouiller dans les descentes de gradient ? »
Et là, c’était la panique : « Euh… vous pouvez définir ce que vous entendez par “gradient” ? ... euh oui je vois non en fait euh.... pour les questions techniques euh... oui... euh... on les notes et on revient vers vous par email»
J’ai quitté le call 2min après.
C'est la réalité et le coeur du problème. Il y a des responsables "IA" qui n'ont absolument aucune idée de ce que c'est l'IA. Du coup on vise à coté et à coté et à coté depuis 20 ans en Europe dans le privé ou dans le public.
Le problème avec l'IA c'est que c'est un sujet à la mode, donc tout le monde veut monter dedans et être "responsable" et donner son avis, la réalité à mon sens, c'est que si tu ne connais rien à comment fonctionne le Machine Learning tu ne devrais pas occupé des postes "technique" ou tu dois décider de l'avenir de cette technologie.
@cleeeeeeeeement En régie avec un client pendant 4 ans avec un TJM de 700 c'est pas plus mal, parfois il faut accepter que tout le monde n'est pas fait pour l'entrepreneuriat comme tu l'entends 😁
Announcing OpenWorker! An open-source agent that doesn't just chat with you, but delivers finished work -- like hand you a polished document, send a slack message, or update a calendar entry.
Ask it to prepare a customer brief, untangle your calendar, draft a report, or triage a Slack alert. It works across your files and everyday tools, produces the deliverable, and checks in before doing anything consequential.
OpenWorker runs on your Mac, with Windows support coming soon. It does not lock you into any one model. Bring your own API key and run it with GPT 5.6 Sol, Claude Fable, Gemini 3.6, an open weight model (like Kimi, GLM, DeepSeek, Inkling), or Ollama to keep your data local. Your data does not leave your machine except through an LLM provider and integrations that you choose.
@rohitcprasad and I are building OpenWorker because AI coworkers are an important way to get work done, and we want there to be an open, privacy-preserving, model-independent option. Check it out and let us know what you think!
Try it out: https://t.co/P0mGnI1o31 (requires your own API key)
Source code: https://t.co/NYCiTD6hSq
Humans try hard things, fail, learn, and get better through repetition.
AI models aren't as different as you might think.
Here's how models "learn" explained in simple terms. https://t.co/gFaNuyVliT
We removed ~80% of the Claude Code system prompt for our newest models, this is what we've learned about writing system prompts, skills and Claude.MDs for them. https://t.co/6DZwSrZjE9
Introducing FLUX 3.
One multi-modal model for Image, Video, Audio and Action-Prediction. Creations are truer to life in every kind of style.
FLUX 3 Video is now available in early access (link below).
Jointly trained in one unified architecture, our model can be extended to predict actions for robotics. See our work with mimic and Audi in the thread.