Bon, j’ai déjà pas mal posté.
Moi c’est Jules : je build mes IA de code (apprentissage, boucle, LoRA, sandbox).
Je teste ce qui marche.
Je fais aussi des agents IA pour PME dans plein de domaines différents.
Chiffres bruts + galères, bienvenue dans le labo 🧪
AWS vient de geler Bedrock Agents Classic pour les nouveaux clients.
Pourquoi c’est intéressant :
Les plateformes agents bougent tellement vite que même AWS est obligé de ranger son ancienne version en « Classic » après seulement 2 ans et demi.
Ceux qui ont tout misé sur une seule couche d’orchestration se retrouvent déjà avec un outil qui n’évolue plus.
Le stack agents de 2024-2025 vieillit beaucoup plus vite qu’on ne le pensait.
À force de parler des problèmes (sandbox qui fuient, agents qui s’échappent…), on oublie parfois l’autre côté.
OpenAI vient de révéler que leur modèle Astra (pas encore sorti) a résolu une dizaine de problèmes mathématiques et d’informatique théorique ouverts depuis longtemps.
L’IA qui avance vraiment la science, la santé, la recherche… c’est aussi ça.
@fberrez C’est exactement le point le plus important de leur incident.
Dès que tu donnes un accès réel (internet, outils, etc.), la limite doit être technique et en dehors du prompt.
Sinon c’est juste une consigne… et les consignes, les modèles savent les contourner.
Anthropic vient d’avouer que Claude a réellement pénétré les systèmes de 3 organisations pendant des tests.
Cause : une mauvaise config qui lui a donné accès à internet.
Question simple :
Vos agents ont accès à internet en prod ?
Si oui -> comment vous les sandboxez vraiment ?
Si non -> vous comptez le faire un jour ?
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different organizations.
Our post describes what happened, how it happened, and what we’re changing. We encourage other AI developers to perform similar reviews.
We conducted this review together with @Irregular, one of our evaluation partners, and thank them for the joint investigation and their collaboration on this post. This type of collaboration is increasingly critical to safe, rigorous evaluation of models, and we look forward to continuing to work together on security.
https://t.co/dKFCdpKd9v
@GJosiat Pour du code, un 14B ça devrait bien tourner sur ta config.
Le 24B sera plus juste par contre, surtout si tu veux garder un peu de marge. (si tu fais tourner les deux en même temps bien sûr)
@GJosiat Honnêtement là sur 32g de ram je fais tourner un 30B de chez qwen, je te déconseille le 4b j avais testé et je le trouve trop faible pour ce que je voulais en faire en tout cas,
Tu veux l utiliser pour quoi ?
Le terme le plus utilisé c’est « quantization » (ou quantification).
Tu prends un modèle et tu réduis la précision de ses poids (souvent en 4-bit ou 8-bit) pour qu’il tourne sur du matos plus léger.
Y’a aussi le pruning (élagage des connexions inutiles) et la distillation, mais la quantization c’est vraiment ce qui permet de faire tourner des modèles corrects sur un i3 avec 34 Go de RAM.
Exactement.
C’est trop souvent traité comme un on/off,
alors que dès que tu donnes l’accès, tu ouvres une surface d’attaque complète.
La vraie question c’est :
quelles permissions précises, dans quel contexte, et avec quel monitoring derrière.
Perso je bosse sur une IA de coding à côté jss par pure curiosité 🤣 et j ai implémenté la connexion à internet mais de façon extrêmement régulée
C’est exactement la question.
On sait pour Anthropic parce qu’ils l’ont dit.
Pour les autres, on a beaucoup moins de transparence.
Et oui, le vrai sujet n’est plus « est-ce que c’est possible »,
c’est « combien de gens ont déjà le matos + les compétences pour le faire ».
Mais comment faire pour réguler ça à part installer des gardes fou et que les entreprises renforcent leur cyber sécurité j ai pas la réponse 🤷♂️
Le goulot d’étranglement des agents a changé.
En 2024, le problème c’était le raisonnement.
En 2025, c’était les outils et le function calling.
En 2026, ce n’est plus ça.
Le vrai blocage aujourd’hui, c’est tout ce qui se passe après que le modèle a décidé quoi faire.
La plupart des agents sont encore conçus comme ça : Modèle → outils → réponse.
C’est une architecture de chatbot amélioré. Or dès qu’un agent doit accéder à des systèmes sensibles, exécuter des actions irréversibles, payer, signer ou modifier des données en production, cette architecture devient dangereuse ou inutile.
Ce qui devient critique :
- L’identité de l’agent (qui est-il vraiment ?)
- Les permissions granulaires (pas juste « il a accès », mais « il a le droit de faire cette action, dans ce contexte »)
- La capacité d’agir dans le monde réel avec un vrai audit trail
Sans ces trois couches, on reste dans du prototype sophistiqué.
C’est pour ça que les frameworks agents de 2024-2025 commencent déjà à sentir le legacy.
Ils ont été conçus pour faire dialoguer un LLM avec des outils, pas pour faire exister un agent comme une entité qui agit de façon responsable dans un système.
On voit d’ailleurs les premiers signaux : standards d’identité, protocoles de paiement autonomes, plateformes qui gèlent leurs anciennes versions d’agents…
Le marché se déplace vers la couche « agent as actor », pas juste « agent as reasoner ».
Vous en êtes où sur ces sujets (identité, permissions, actions réelles) ? Vous les traitez déjà sérieusement ou c’est encore secondaire face au modèle ?
@solopribuilds because with the models coming out, hallucinating is not a problem anymore
If you build harness, loop control over it pretty sure you ll never see it hallucinating again
DeepSeek vient de sortir V4 Flash.
Ce qui est intéressant :
-> Gros gain sur les capacités agentiques
-> Prix ridiculement bas
-> Et les poids arrivent bientôt
On a de plus en plus de modèles open (ou quasi) qui rattrapent le niveau des frontier sur beaucoup de tâches… pour une fraction du prix.
Ceux qui buildent encore uniquement sur les modèles fermés les plus chers commencent à se priver d’options très intéressantes.
DeepSeek just launched the official DeepSeek-V4-Flash API in public beta.
The update delivers a major boost to agent capabilities. Benchmark scores now beat the earlier V4-Pro-Preview across the board. Terminal Bench 2.1 hits 82.7, up from 61.8 on the preview. DeepSWE jumps to 54.4 from 7.3. Other gains include NL2Repo at 54.2, Cybergym at 76.7, Toolathlon-Verified at 70.3, and strong results on DSBench-FullStack and DSBench-Hard.
The model keeps the same architecture and size as the Flash preview. Only post-training changed. The upgrade applies solely to the V4-Flash API. V4-Pro API and the app or web models stay the same for now. Official V4-Pro release is next.
V4-Flash now supports the Responses API format natively and works fully with Codex.
Full configuration details and docs: https://t.co/719w09nHvx
#DeepSeek #AI #LLM #AgenticAI #OpenSourceAI #API #MachineLearning #CodingAgents #DeepSeekV4
@WatchServ Ahhh merci pour le retour j ai pas eu le temps de vrmt bien explorer le sujet avec deepseek mais c est bon a savoir
il est bon pour faire les taches mais pas forcément pour la vision/raisonnement global
Sûrement bon à intégrer dans une boucle mais pas en tant que cerveau ?
Oui, et je pousserais même un cran plus loin.
Le vrai sujet n’est plus « fermé vs open »,
c’est « quel modèle pour quelle partie de la chaîne ».
Sur certains tâches agentiques, un modèle open bien piloté peut déjà battre un frontier fermé…
surtout quand tu contrôles l’environnement, la mémoire et les outils.
Le mix devient intéressant, mais seulement si tu arrêtes de traiter tous les modèles de la même façon.
@cleeeeeeeeement Déjà plus de limite de 5h 🎊, et je le trouve bcp plus apte à gérer des tâches longues etc, j y suis passé il y a deux sem et ça fait vrmt le taff
Important que nos leader se réveille concernant l’IA, mistral c est bien mais quand on voit tout le potentiel de cette révolution technologie/industriel..
Il y a bien plus a aller chercher que ça, 30B€ d’investissement c est déjà un pas dans le bon sens !
Surtout qu a mon sens on a largement de quoi faire en terme d’infra pour développer des IA qui peuvent se battre avec le top, OpenIA, Grok, Kimi, Anthropic…
On a des entreprises au top de leur domaine, schneider, ASML, etc.
Il nous suffit juste de pas louper trop de wagon !
Vous pensez que c est possible de développer l’IA conjointement en Europe ?
AI is the most important technology of our time.
Europe wants to become the first AI Continent.
For advanced healthcare, for the transport sector and so much more.
European AI Gigafactories will provide the necessary computing power to make this possible.
Together with our Member States, we are funding their construction with up to €10 billion, which are set to unlock at least €20 billion in private investements across the EU.
Together, we are building our technological sovereignty.
https://t.co/Vxko4TRXVL
@leploutos Paperclip en premier ! C’est clairement fait pour manager une équipe d’agents comme une vraie boîte (org chart, budgets, goals, tracking des coûts).
Buzz c’est plus cool pour de la collab décentralisée humain + agents sur Nostr, mais moins orienté “run a business”.