Les seuls skills qu'il vous faut pour améliorer drastiquement la qualité de votre contenu sur X :
Du planning de contenu au post quotidien, en passant par l'humanisation de votre voix et l'optimisation de votre profil X. Tout est couvert.
Le lien en réponse👇
Après 24h d'utilisation et beaucoup de ressources feuilletées, voici ma review de Grok 4.6.
Grok 4.6 donne l'image d'un modèle rapide et entraîné comme un perfectionniste. Bon marché à la grille tarifaire, cher dans la session. C'est toute la review.
Même base 1,5T que le 4.5. Aucun nouveau cerveau pré-entraîné, tout le gain vient du post-entraînement. Du coup il ne paraît pas plus intelligent que Fable, il paraît comme un 4.5 qui refuse de s'arrêter de fouiller.
Artificial Analysis confirme le profil : 61 à l'index, à égalité avec GPT-5.6 Sol, derrière Opus 5 (63) et Fable 5 (62). Sur le travail de connaissance long, il boucle en ~53 tours et 0,5B de tokens en entrée, contre ~103 tours et 2,0B pour Opus 5. Verbeux à la demande, moins cher à la tâche finie. La plupart regardent le mauvais des deux.
Où il gagne : le travail de connaissance, pas le leetcode. Il mène GDPval-AA (1753) et AA-Briefcase (1577), et sort 15,8% à Harvey LAB contre 2,5% pour Sol. En visuel et applications interactives, il produit une vraie interface en une passe là où le 4.5 enchaînait les tours. En vérification, le 4.5 sautait les captures, le 4.6 vérifie comme Opus ou Sol.
il reste derrière Sol sur DeepSWE (65,9% vs 72.7%) et Terminal-Bench 3.0 (26% vs 34,6%). Le code à l'échelle du dépôt et l'usage en ligne de commande, ce n'est pas son point fort. Il se décharge encore par moments sur l'utilisateur. Et il est plus lent que le 4.5 dans Cursor, même en mode rapide : plus d'outils, plus de réflexion, tu attends.
Dans Cursor, c'est l'effort que tu règles qui change le plus. L'effort par défaut est élevé, mais très élevé toute la journée grille la fenêtre 256k. Si tu le laisses en réglage par défaut et que tu t'en plains, je t'aurai prévenu.
Sur le prix, ça varie. En API, 2$/6$ tient sous 200k, au-delà toute la requête double à 4$/12$. 500k de contexte en API, 256k dans Cursor. Bourrer le contexte, c'est mettre le feu au modèle pas cher. Dans Cursor il tombe dans l'enveloppe incluse (grok/composer), pas comme Opus/Sol/Fable, c'est le discount qui fait plaisir.
Règle d'usage après ~24h d'utilisation : réserve le aux moments où le résultat fini compte plus que la rapidité. Monte l'effort à très élevé pour les tâches exigeantes, tu le baisse dès que la demande est claire. Le token est pas cher, la session ne l'est pas forcément.
Et toi, Grok 4.6 tu le décrirais comment après l'avoir testé ?
Strongly disagree on multiple points here :
The "pick one of 4, label them by job" rule sounds clean. it's a constraint with good intent. but two of the four labels are wrong, and the default is the most expensive mistake in the set.
"If you don't know > fable 5."
when you don't know you explore. lots of tokens, lots of dead ends. fable is the priciest here at $10/$50 per M. you pay the most to wander.
"If you know what you want? Use GPT 5.6 Sol" hits sol's weak spot.
It waits for "do it" and over-spawns subagents on mid-size tasks, the exact mechanical work you thought you'd delegated.
Default in your list should be sol. cheaper, concise, it rubber-ducks the plan back at you.
When you don't know you explore. lots of tokens, lots of dead ends. fable is the priciest here at $10/$50 per M. you pay the most to wander.
Grok 4.6 vient de sortir, et les benchmarks sont très intéressants.
Je vous explique déjà ce que mesure chaque benchmark ici. 👇
GDPval-AA v2 1753
Des tâches professionnelles réelles : documents, slides, spreadsheets, analyses…
Grok 4.6 passe devant GPT-5.6 Sol et Fable 5.
Ce n’est plus juste du reasoning. C’est la capacité à produire un livrable exploitable.
CursorBench v3.2 69.9%
Des tâches de coding ambiguës et multi-fichiers directement dans un environnement d’éditeur.
Très proche de ce qu’on demande réellement à un coding agent.
DeepSWE v1.1 65.9%
Des problèmes d’ingénierie logicielle longs, avec exploration du repo, modifications, tests et validation.
On mesure la capacité à mener une tâche de dev jusqu’au bout, pas juste à générer du code.
FrontierCode v1.1 61.3%
Des tâches de coding difficiles où la qualité du code compte autant que sa correction.
Intéressant pour mesurer si l’agent produit du code réellement maintenable.
APEX-Agents 57.5%
Des tâches longues qui traversent plusieurs applications et outils : finance, consulting, juridique…
Là, on commence à mesurer du vrai travail de knowledge worker.
Terminal-Bench 3.0 26%
Des tâches complexes directement dans un terminal : code, debugging, systèmes, ML…
L’agent doit observer son environnement, utiliser des outils et s’adapter aux erreurs.
APEX-SWE 56.4%
Intégration de systèmes + debugging de problèmes de production avec logs, dashboards et télémétrie.
Très proche du travail d’un ingénieur dans un environnement réel.
AA-Briefcase 1577
Des projets de knowledge work avec fichiers, outils, analyse et production de livrables.
Grok 4.6 dépasse ici GPT-5.6 Sol et Fable 5.
Harvey LAB 15.8%
Des tâches juridiques longues basées sur de vrais documents et des livrables professionnels.
Et surtout : Grok 4.6 explose son prédécesseur sur ce type de travail spécialisé.
Artificial Analysis Intelligence Index 61
Un indice composite qui agrège plusieurs capacités.
Grok 4.6 rejoint GPT-5.6 Sol.
Ce n’est donc pas juste un meilleur modèle. Il semble surtout devenir beaucoup plus capable d’exécuter du travail complexe sur plusieurs étapes.
Le plus intéressant dans ces benchmarks n’est donc pas seulement le score, mais ce qu’il représente en production.
Sur des agents IA notamment, chaque point de réussite supplémentaire peut être une tâche de moins à reprendre manuellement. Parce qu’au final, la valeur d’un agent ne se mesure pas au nombre de réponses qu’il génère.
Elle se mesure au travail qu’il peut réellement vous retirer.
Vous allez tester Grok 4.6 pour quels types de tâches ?
Astuce Hermes que vous allez adorer : /moa, cette fonction que tout le monde sous-utilise.
Vous posez une question difficile à votre agent, il rend une réponse. Et si elle est fausse, vous ne le savez pas.
Au lieu d'interroger un seul modèle, il envoie le même prompt à plusieurs en parallèle. Chacun raisonne de son côté. Un modèle agrégateur lit les réponses et synthétise la meilleure.
Le point qui change le quotidien : ça reste dans la boucle de l'agent. Tools, memory, sessions, interrupts, tout marche. Une fois la tâche finie, Hermes repasse sur le modèle que vous utilisiez. Les implémentations externes perdent tout ça dès le détour, le contexte outil est viré. Ici non.
Le désaccord entre modèles est un signal intéressant. Un modèle seul a un angle mort, plusieurs se le signalent. Même des modèles individuellement plus faibles, une fois combinés, dépassent le modèle frontier. La diversité des perspectives compte plus que la force brute d'un seul.
Hermes rend ses profils portables. Tu exportes skills, mémoire, persona, plugins, crons, avec les credentials retirés. Tu importes le fichier sur une autre machine. Ton setup voyage avec toi.
Le point important selon moi, c'est un process de dev. Tu construis et testes un agent en local, puis tu le déploies en prod. La même boucle que pour livrer une app, appliquée à un agent.
Les variables d'environnement ne partent pas avec le profil. Hermes les retire à l'export, et c'est ce qui rend le partage sûr.
Et pour les équipes, la friction disparaît. Tu exportes une fois, tout le monde importe le même workflow exact. Personnalisations intactes, credentials isolés. L'onboarding cesse d'être une tâche de setup.
Portable, reproductible, versionnable. Hermes applique le cycle de vie d'un logiciel à un agent : on le dev, on le package, on l'installe, on le met à jour.
Hermes profiles are now portable and shareable:
Run /export to save a profile as a single file with credentials stripped: skills, memory, persona, crons, plugins, settings, desktop themes and layouts.
Then /import loads the profile file, and your setup is up and running.
Les agents IA ont tellement permis à n'importe quel utilisateur de concrétiser une tâche quelconque rapidement, qu'ils en oublient les fondamentaux (qu'ils n'ont jamais appris) et les principes d'architecture indispensable : Keep It Simple Stupid, éviter l'over-engineering, comprendre comment ça fonctionne, etc.
Les posts sur les agents IA hyper complexes sont vus comme le graal, alors qu'ils fonctionneraient mieux en restant bien plus simples. 😁
@pgllmt Même philosophie de least privilege de mon côté. Mon agent fait un recap matinal mais il ne touche pas à mes comptes.
Le point qui me parle dans ton setup c'est de retirer la capacité d'envoi, pas seulement interdire par prompt, ce qui serait plus fragile.
J'ai un agent qui me fait un recap chaque matin des news les plus intéressantes sur l'IA, l'agentic, sauf que je suis obligé de le lire tout les matins, 15-20 minutes bloquées dessus.
Maintenant Grok va me résumer tout ça en vocal pendant que je prends mon petit dej.
Grok can now turn your daily news research into a voice memo you can just listen to
Ask it to research everything important from the last 24 hours, summarize the major events, and package it into an audio briefing
So instead of reading through dozens of stories, you can just press play and catch up on everything in a few minutes
With different voices available, it basically becomes your own personalized daily news show
@_yaksan le vibe-coding a apporté la possibilité aux infopreneurs de faire croire qu'ils ont la capacité de build des produits, avec des belles landing pages, et plus seulement de vendre des formations
@maximilien912 les repo qui enlèvent les watermarks sont déjà créés à la pelle, encore une superbe loi de nos technocrates qui ne sert à rien si ce n'est bruler plus.
https://t.co/XhLYmd58wG