ça build quoi aujourd'hui? Moi je suis sur un petit RAG pour de la documentation. Je suis tombé sur ce vieil article d'Anthropic pour améliorer la récupération des chunks pertinents (par l'ajout de contexte avant l'embedding), si jamais ça intéresse quelqu'un: https://t.co/BFKPScdXFK
Le 98.6% sur le ARC-AGI-3 vient bien d’un harness d’où le « [1] ». Apparement gpt 5.6 sol avec le même setup tournerait autour des 40%
« The standout is its 98.6% score on ARC-AGI-3. OpenAI ran Astra with a Responses API harness that retains reasoning between turns and uses compaction to manage long contexts. The company previously demonstrated that those system choices can substantially raise ARC-AGI-3 scores without changing the underlying model, and the benchmark measures Astra and OpenAI’s agent systems together. »
@OkbaSoufli49365 Ok ok je trouvais ça suspicieux le 98.6% sur ARC-AGI-3 mais en fait apparemment ils ont utilisé un harness donc c’est pas comparable aux autres ahah
Mais quand même une folie sur le reste du coup effectivement
❤️🔥 Claude Fable 5 is so back!
Just Recorded a 16 min Tutorial on How to use Claude Fable 5 to Build Cinematic $50k Websites (step-by-step)
Anyone can now build stunning sites fully with AI
En vrai ça dépend de ce qu'on entend par « bulle », y a bien eu la bulle internet alors que c'est maintenant 100% adopté et indéniablement utile. Pour l'ia j'ai l'impression que c'est plus ou moins pareil, c'est indéniablement utile, très adopté mais y'a de l'abus sur les investissements (suffit de regarder les derniers batch YC mdrr)
@AIC_Hugo Et Muse Spark 1.3 qui score à 75.4% le DeepSWE 1.1 à 1,25$/4,25$ mais 0,10$/0,20$ si tu laisses le modèle s’entraîner sur tes convs, on est en train de bien manger cette semaine
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the biggest jump we've made so far on coding and agentic work. Try it in Muse Code and our API.
Next up 🍉 and Muse Spark open weights releases coming soon.