Fière d'avoir témoigné de mon parcours et de mon quotidien d'ingénieure avant-vente en Datascience & #IA@segula_group et d'avoir pu apporter des élements de réponse à toutes celles et ceux qui souhaitent se lancer dans la #DataScience Merci à @Deezer de nous avoir accueilli
[Meet-up #DataScience] Les compétences clés pour devenir Data Scientist : maîtrise des mathématiques, bases en développement, anglais, adaptation, avoir un esprit analytique & rigoureux, être pédagogue, savoir vulgariser, la curiosité intellectuelle
#morewomenintech#Softskills
Si vous êtes dev en France et que vous vous demandez quoi apprendre en 2026, ce post est pour vous 👇
Je communique assez peu en Français mais si je peux aider les Francophones à faire les bons choix sur quoi apprendre
je me présente : je suis Brivael, co-founder tech de @argildotai, j'ai fait Y Combinator en 2024 et j'ai levé 5 millions d'euros.
On est actuellement une team de 11 personnes basée à Paris et on construit ce qui sera vu dans le futur comme une sorte d'AGI / Agent pour produire des vidéos pour les réseaux sociaux
Aujourd'hui on a des dizaines de milliers d'utilisateurs, on est focalisé sur la génération de vidéos avec des avatars IA, mais on va s'élargir à beaucoup plus que ça très bientôt.
Si vous voulez prendre la vague AI, c'est encore possible. mais il faut être honnête sur ce que ça demande.
Pour paraphraser @naval : il n'y aura plus de demande pour les gens moyens.
C'est brutal mais c'est la réalité. si vous ne trouvez pas un moyen d'être dans le top 5% de ce que vous faites, vous serez inemployable. pas dans 10 ans. bientôt.
Chez Argil on est 7 tech en interne. et on est en train d'automatiser quasiment entièrement la construction du software.
Nos journées se résument de plus en plus à une seule chose : concevoir des systèmes agentiques, valider l'architecture, orchestrer des agents IA pour qu'ils fassent le reste.
Le code classique ? les agents le font déjà. ce qui a de la valeur aujourd'hui c'est la capacité à penser en systèmes, à comprendre comment orchestrer des modèles ensemble, à savoir quand un agent doit décider et quand il doit déléguer.
Et c'est là que beaucoup se trompent : même si l'IA produit 100% du code, sans maîtrise du software engineering, de l'architecture et des systèmes dans leur globalité, c'est quasi impossible de concevoir des systèmes agentiques qui fonctionnent at scale. il faut comprendre le sous-jacent pour pouvoir le challenger. les connaissances transverses — infra, distributed systems, design patterns — c'est pas optionnel, c'est le prérequis.
Meilleur timing pour devenir un ingénieur généraliste / builder curieux de tout.
Est-ce que c'est dur de sortir du lot en tant que junior aujourd'hui ? oui, très. mais c'est toujours possible de jouer sa carte si vous ��tes prêts à aller plus loin que les autres.
Posez-moi vos questions en commentaire, je vous donne mes conseils et on en fait un thread.
Google vient de publier un papier qui compresse les LLMs à 3 bits. 8x plus rapide, 6x moins de mémoire. Zéro perte de performance 🤯🤯🤯
Le truc c'est que la méthode est élégante au point d'en être presque triviale une fois qu'on la comprend.
Ça s'appelle TurboQuant. Je vous vulgarise tout le paper :
Déjà, le problème de base.
Quand un LLM génère du texte, il doit se "souvenir" de tout ce qu'il a lu et écrit avant. Ce système de mémoire s'appelle le KV cache (key-value cache).
Imaginez un étudiant qui prend des notes ultra détaillées pendant un cours. Plus le cours est long, plus ses notes prennent de place sur son bureau. À un moment il n'a plus de place pour écrire.
C'est exactement ce qui se passe avec les LLMs : plus le contexte est long, plus le KV cache explose en mémoire. C'est un des plus gros bottlenecks de l'inférence aujourd'hui.
La solution classique c'est la quantization. L'idée est simple : au lieu de stocker chaque nombre avec une précision extrême (32 bits, genre 3.14159265...), tu le stockes avec moins de précision (4 bits, genre "~3").
C'est comme passer d'une photo RAW de 50 MB à un JPEG de 2 MB. Tu perds un peu de détail mais visuellement c'est quasi pareil.
Le problème c'est que les méthodes classiques de quantization trichent un peu. Pour chaque petit bloc de données compressé, elles doivent stocker des "constantes de calibration" en pleine précision.
C'est comme si pour chaque photo JPEG vous deviez garder un petit post-it en haute résolution à côté qui dit "voilà comment décoder cette image".
Ces post-its rajoutent 1 à 2 bits par nombre. Quand tu essaies de compresser à 2 ou 3 bits, cet overhead représente une part énorme de ta mémoire totale. Ça annule une bonne partie du gain.
TurboQuant résout ça en deux étapes.
Étape 1 : PolarQuant.
Au lieu de décrire un vecteur avec des coordonnées classiques (X, Y, Z), tu le convertis en coordonnées polaires : une distance + un angle.
C'est comme remplacer "va 3 rues à l'est puis 4 rues au nord" par "va 5 rues direction 37 degrés". Même info, format plus compact.
L'astuce c'est qu'avant de faire ça, tu appliques une rotation aléatoire sur tes vecteurs. Ça rend leur distribution prévisible et uniforme. Du coup tu n'as plus besoin de stocker les fameuses constantes de calibration, la géométrie fait le travail toute seule.
Étape 2 : QJL (Quantized Johnson-Lindenstrauss).
Après PolarQuant il reste une petite erreur résiduelle. QJL la corrige avec 1 seul bit par nombre.
Le principe vient d'un théorème mathématique qui dit qu'on peut projeter des données de haute dimension dans un espace plus petit tout en préservant les distances entre les points.
QJL pousse ça à l'extrême : il réduit chaque valeur projetée à juste son signe (+1 ou -1). Un seul bit. Et grâce à un estimateur spécial qui combine la query en haute précision avec ces données ultra compressées, le modèle calcule toujours des scores d'attention précis.
Les résultats sont assez dingues.
Sur les benchmarks long-context (LongBench, Needle in a Haystack, RULER...) avec Gemma et Mistral : zéro perte de performance à 3 bits. Le KV cache est réduit d'un facteur 6x. Et sur H100, le calcul des scores d'attention est jusqu'à 8x plus rapide qu'en 32 bits.
Le tout sans aucun fine-tuning ou entraînement supplémentaire. Tu branches, ça marche.
Et le plus intéressant : ça ne sert pas qu'aux LLMs.
TurboQuant surpasse aussi les méthodes state of the art en vector search, c'est à dire la techno qui permet de chercher par similarité dans des bases de milliards de vecteurs (ce qui fait tourner Google Search, les systèmes de recommandation, le RAG...).
Mon take : l'inférence c'est là où se joue la vraie bataille économique de l'AI.
Les marges de toute l'industrie dépendent du coût par token en production. Un gain de 6 à 8x sur la mémoire et la vitesse d'inférence, sans aucune perte de qualité, ça change fondamentalement l'équation.
Ce type de recherche ne fait pas de bruit sur Twitter mais son impact business est potentiellement supérieur à celui d'un nouveau foundation model.
Reasons why Moltbook AI agent communication fears may demonstrate why SentinelOne $S, Rubrik $RBRK, and Zscaler $ZS are CRITICAL IMO for AI prompt security, traffic and rewind protection:
SentinelOne: The "Prompt Firewall" Expert View
- SentinelOne's GM of Prompt Security, Itamar Golan, and the SentinelLabs team have highlighted that Moltbook exposed the "confused deputy" problem. Agents were tricked by "Indirect Prompt Injection" because they couldn't distinguish between a command from their owner and a command hidden in external data.
- "Prevention is moving to the prompt level." SentinelOne colleagues argue that the Singularity Platform is now the only one offering a dedicated AI Security Gateway that redacts sensitive data and blocks "malicious instructions" before the agent even processes them.
Rubrik: The "Resilience as the Only Truth" View
- Rubrik CEO Bipul Sinha has framed Moltbook as the "SolarWinds of AI." His view is that since agents have autonomous identities (and those identities were leaked in the breach), the "perimeter" is gone
- "If you can't stop the agent, you must be able to undo it." Rubrik employees are rallying around Agent Rewind, a tool designed specifically to snapshot the state of a system before an agent acts and "roll back" the damage if that agent was hijacked.
Zscaler: The "Non-Human Identity" Problem
- Zscaler's EVP of Cybersecurity, Deepen Desai, has been vocal (Jan 27–Feb 1, 2026) that AI agents represent a new class of "Non-Human Identities" that traditional firewalls can't see.
- Desai argues that in the Moltbook era, an intrusion moves from discovery to data theft in minutes. Zscaler's Zero Trust Exchange is being positioned as the "Mediator" that inspects every A2A (Agent-to-Agent) transaction.
- "Shadow AI" Discovery: Colleague insights from Zscaler's ThreatLabz highlight that 100% of enterprise AI systems tested were vulnerable to compromise in under 16 minutes.
- Employees are rallying around the new AI Security Suite (launched Jan 29). They view the Moltbook breach as a "Market Validation Event" for their MCP (Model Context Protocol) Gateway, which acts as a secure "bouncer" for agents talking to models.
I remain LT bullish & added on pullbacks last week:
- Awareness of Moltbook-style risks moves $S, $RBRK and $ZS from "nice-to-have AI tools" to "mandatory infrastructure."
- You cannot have an autonomous agent economy without a way to filter its prompts (SentinelOne), a way to undo its mistakes (Rubrik), and a way to manage AI traffic (Zscaler).
- Software has pulled back significantly, but you can't replicate cybersecurity like other SaaS products!
The most powerful storage with the least energy used. The highest IOPS per watt - more than any other #storage vendor.
🌟 We’re thrilled to share @ENERGYSTAR has ranked our storage in the 🏆 top three spots for performance & energy efficiency. Learn more: https://t.co/BTpJxcm0oThe most powerful storage with the least energy used. The highest IOPS per watt - more than any other #storage vendor.
🌟 We’re thrilled to share @ENERGYSTAR has ranked our storage in the 🏆 top three spots for performance & energy efficiency. Learn more: https://t.co/BTpJxcm0or
Quantization Is All You Need
SOTA LLMs are too large to run on laptops. Quantization is a technique used to reduce LLMs' computational and memory requirements and create a smaller version of the model. Quantization is central to OSS progress
It involves converting the model's parameters, typically stored as 32-bit floating-point numbers, into lower-precision formats such as 16-bit or even 8-bit integers.
This process significantly decreases the model's size and accelerates inference speed, enabling deployment on resource-constrained devices. Quantization can affect model performance, but the trick is finding a balance between model compression and accuracy, achieved through careful calibration and fine-tuning of the quantization process.
This visual guide is an excellent way to learn about quantization (link in alt)
⚡ Accelerate insights and unlock innovation with Hitachi iQ. 🌟 Discover the top 10 reasons why it’s the perfect AI solution suite for businesses committed to AI emergence: https://t.co/OUVBioyLq0
🤔 Can #technology such as #AI, storage, and #IoT come together to predict wildfire threats?
As the summer races toward being the hottest ever, our own Bjorn Andersson examines the ways to get in front of the fire 🔥 https://t.co/VjNlZSM0Hp @InformationWeek@bearcrossings
« Chaque g��nération, sans doute, se croit vouée à refaire le monde. La mienne sait pourtant qu'elle ne le refera pas. Mais sa tâche est peut-être plus grande. Elle consiste à empêcher que le monde se défasse. »
Albert Camus