Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding AutomationBench-AA, an agentic workflow automation benchmark with a private test set. This is a continuation of our rollout of Intelligence Index v5
Changelog (Index v4.2 → Index v4.3):
➤ Terminal-Bench: 2.1 → 4.0, completing our upgrade to the latest version of Terminal-Bench
➤ Replacing 𝜏³-Banking with AutomationBench-AA, our implementation of Zapier's business workflow automation benchmark
We are continuing to prioritize keeping Intelligence Index as useful as possible by bringing forward a subset of the changes we had planned for Index v5. Each change in v4.2 and v4.3 stands on its own merits and brings the Index closer to real-world problem solving, adds more private test sets to prevent gaming, and reduces saturation
Intelligence Index v4.3 raises the difficulty of agentic coding tasks and broadens the types of agentic workflows tested. Because we use a held-out test set for AutomationBench-AA, in collaboration with @zapier, the weight assigned to evaluations with private tasks or answers increases from 40% to 45%. Category weights are unchanged from v4.2: Agents 30%, Coding 20%, General 30%, Scientific Reasoning 20%
Detailed changes:
➤ Upgraded Terminal-Bench 2.1 to 4.0: 66 multi-step tasks testing agents on tasks run in agent sandboxes driven via the terminal, including tasks involving software engineering, machine learning, science, and operations. The 4.0 update recalibrates compute and time allowances, and improves task instructions and verification. We have changed from the Terminus 2 harness to mini-SWE-agent, a minimal, model-agnostic harness. We will also be updating our Coding Agent Index, where we test model and harness pairs, to include Terminal-Bench 4.0 soon
➤ Replaced 𝜏³-Banking with AutomationBench-AA: Our implementation of Zapier’s AutomationBench tests agents on 657 business workflows across simulated applications such as Gmail, Slack, Salesforce, and Jira. Agents must complete task objectives while following business rules. AutomationBench-AA uses Zapier’s private set of 657 tasks, and is built on v1.0.6
Key results:
➤ Claude Fable 5.1 and GPT-6 Astra lead the Intelligence Index: Both Claude Fable 5.1 (max with fallback) and GPT-6 Astra (max) score 53 on Intelligence Index v4.3, followed by Claude Opus 5 (max, 51), Claude Fable 5 (with fallback, 50), Muse Spark 1.3 (max, 48) and GPT-5.6 Sol (max, 47)
➤ GLM-5.3 and Kimi K3 continue to lead open weights models (both at 44): GLM-5.3-Flash (42) is the third strongest open weights model, followed by Qwen3.8 2.4T A95B (40) and DeepSeek V4 Pro 0813 (max, 36)
➤ 4 labs occupy the Intelligence vs. Cost per Task Pareto frontier: OpenAI occupies the majority of the cost-efficiency frontier, with all five reasoning efforts of the recently released GPT-6 Astra offering the lowest Cost per Task at their respective levels of intelligence. Claude Fable 5.1 (xhigh, max, 53), GLM-5.3-Flash (42) and MiMo-V2.5-Pro (26) round out the rest of the frontier
🔴 ¿DRAMA MATEMÁTICO DEL MILENIO?
Ojito que podríamos estar ante una de las noticias matemáticas más importantes de la década, por lo que simbólicamente representa, y sin embargo esta viene envuelta para variar en drama.
Tras varios días escuchándose por diferentes redes rumores de que uno de los famosos Problemas del milenio (Navier-Stokes) habría sido resuelto por matemáticos apoyados en la IA, hoy se ha publicado un escrito por uno de los dos matemáticos involucrados -Levent Alpoge, vinculado a Anthropic y Tristan Buckmaster quien es el que firma el escrito, y quien avisa de:
1) haber logrado, tras meses trabajando con la IA, avances claves en una vía que podría conducir a la resolución de NS (!!!) y...
2) según Buckmaster, que OpenAI -quienes también han dedicado inmensos recursos trabajando en este problema- podría estar próximos a publicar una solución completa (!!!), que podría estar fuertemente "inspirada" en la línea de investigación que había perseguido Alpoge y Buckmaster, tras conversaciones entre ellos y OpenAI.
Os sigo contando más detalles en este hilo 🧵👇
Pero como conclusión rápida, por ahora parece que Alpoge y Buckmaster están próximos a publicar sus avances (a la espera de la verificación en Lean) y me imagino que OpenAI algo también tendrá que decir y publicar pronto.
Dramas aparte... ¿Estamos a punto de vivir la resolución de uno de los Problemas del Milenio por parte de la IA? ¿YA?
an important essay on the state of AI and the choices and challenges ahead: for openai, the field, and the world.
we're in the AGI era, and need to approach the next few years with seriousness, thoughtful deliberation, and navigating the collective challenges together. we can make the future so much better than the past.
🚨 Ahora puedes convertir cualquier libro en una skill de Claude.
Normalmente, utilizar un libro completo como contexto puede consumir cientos de miles de tokens antes de hacer una sola pregunta.
Alguien acaba de crear una herramienta open-source para solucionar este problema.
Se llama book-to-skill y transforma cualquier libro en una skill que Claude puede consultar capítulo por capítulo.
Esto es lo que genera:
→ Un archivo SKILL.md con los conceptos principales y el índice completo
→ Un archivo independiente por cada capítulo
→ Un glosario con los términos clave y sus referencias
→ Un documento con todas las técnicas, patrones y algoritmos del libro
→ Una guía rápida con reglas y tablas de decisión
Lo más interesante:
Los capítulos solo se cargan cuando realmente los necesitas.
Puedes instalar 20 libros y Claude únicamente consume tokens del capítulo que estás consultando en ese momento.
Un libro de 400 páginas puede requerir alrededor de 200.000 tokens si lo cargas completo.
Con este sistema, cada respuesta se basa directamente en el contenido del libro y reduces gran parte de las alucinaciones.
Es completamente gratuito y open-source.
Te dejo el repo en comentarios 👇
We’re introducing a new capability to our latest Gemini models: agentic video understanding.
This allows developers to process long-form video content with more accuracy, while using up to 88% less tokens.
See how it works 🧵
◾ | TERREMOTO SOFTWARE GUBERNAMENTAL
Un paper de Zhenfeng Cao (MIT) advirtió un movimiento histórico: el código deja de ser estático para volverse un recurso efímero generado al vuelo por agentes de IA. Algo que sacudirá la noción de soberanía estatal y reconfigurará el poder:
1/ La muerte del código estático
Durante medio siglo, la ingeniería de software consistió en traducir decisiones a código estático. En el nuevo paradigma agéntico (AaaS), el LLM es el motor de razonamiento que sintetiza y desecha código en milisegundos.
2/ Crisis de audibilidad pública
El derecho administrativo exige trazabilidad: una norma se ejecuta mediante algoritmos deterministas. ¿Cómo audita un Tribunal de Cuentas o un juez una decisión estatal si el código que la ejecutó fue efímero y ya no existe en ningún repositorio?
3/ La trampa de la "arquitectura de intenciones"
Los funcionarios pasarán de gestionar trámites a redactar intenciones para bucles de razonamiento autónomo. Quien no controle los modelos base ni el cómputo delegará la ejecución misma de sus políticas públicas en Big Tech transnacionales.
4/ Obsolescencia regulatoria
Las regulaciones actuales (como la Ley de IA de la UE) presuponen código fuente auditable antes del despliegue, sin embargo, frente a agentes autónomos hiperadaptativos que mutan en tiempo real, los marcos normativos tradicionales quedarán desarmados incluso antes de implementarse por completo.
5/ Servidumbre vs. Soberanía
Los Estados sin infraestructura de razonamiento propia sufrirán una captura (entre otras) cognitiva: las políticas públicas quedarán supeditadas a los sesgos, restricciones y alineamientos éticos impuestos por los proveedores privados de los LLM.
6/ La nueva brecha burocrática
Los gobiernos que logren estructurar "arquitecturas de intenciones públicas" desplegarán servicios a velocidad inédita. Pero quienes queden atrapados en la inercia analógica enfrentarán un colapso de capacidad institucional frente a la velocidad del entorno digital.
7/ El desafío constitucional
El reto tecnopolítico en poco tiempo será más concreto y ya no pasará por digitalizar trámites ni contratar software. Será garantizar que los bucles de razonamiento autónomo respeten los derechos fundamentales cuando la lógica de la decisión desaparece tras ser ejecutada.
8/ Posiblemente estemos ante la mayor pérdida de control público sobre la gestión del Estado, pero también ante la oportunidad para refundar la eficiencia de la administración gubernamental.
La pregunta honesta a hacerse en nombre del futuro por la posibilidad de caer en la opresión tecnológica y la reconfiguración de las fronteras soberanas: ¿lo que urge en este momento histórico es posible con estos dirigentes?
La lucha hoy se reduce a eso. Lo contrario podría ser una subordinación irreversible.
📝Paper completo:
https://t.co/7IpoBop3Qp
Introducing the ElevenLabs MCP, now available in Claude.
Your team can manage your voice and chat agents where you already work - review recent performance, create new agents, update configurations, and even estimate LLM costs before changes go live.
Un paper de Google sobre reducción del uso de tokens de agente IA en un 94 % en sesiones largas mediante una representación estructurada del estado actual en lugar de usar todo el historial de conversación.
Sería la mejor noticia para la economía de la IA (de los usuarios al menos) del año.
https://t.co/PKw6AkHgwt
🚨 Un desarrollador acaba de hacer lo que Google no ha conseguido en años.
Ha creado un navegador en Rust que arranca al instante, consume 10 veces menos RAM y bloquea miles de trackers automáticamente.
Acumula más de 10K stars en GitHub, es gratis y open-source.
te explico cómo funciona ⬇️
En las últimas 5 semanas en el panorama open weights nos ha llegado:
✓ GLM 5.2
✓ DeepSeek Flash v4 (súper eficiente! 🔥)
✓ Kimi K3 ≈ Qwen3.8-Max
Con Qwen 3.8 recién salido hoy
¿qué locura es esta?
Veo a la gente hablando mucho sobre Burberry estos días.
Si no la tenéis analizada y solo os estáis guiando por el múltiplo, yo no haría nada.
Es un tipo de lujo aspiracional, tipo $MONC
SIGO
🧵 MEGAHILO de mi 2nda inversión inmobiliaria 🧱
Ya sabéis que soy un amante de la bolsa pero hoy vengo con algo OFFTOPIC.
Así es como he conseguido un ROCE del 20% invirtiendo en un estudio de 36 m2 👇👇👇
Bonus: enlaces y herramientas que he usado durante la reforma al final
✅ Turtle Creek: A different kind of value investing
💥 Así se define uno de los fondos de autor más desconocidos por el público general pero del que se pueden sacar interesantes ideas
👉 ¿Quieres conocer sus 10 principales posiciones? No son las típicas
🧵 Dentro hilo (1/12)
📢Mañana domingo 12/02 a las 20h, nuevo vídeo en nuestro canal de YouTube.
👉Te explicaré la clave para modelizar la variable más importante de cualquier valoración fundamental. ¡No te lo pierdas y suscríbete al canal!
https://t.co/KhU34BOfr5
🎙️Nuevo Podcast !
Esta semana nos juntamos los 4 del @ClubdelValue para hacer un repaso a 2022, la situación macro actual y que oportunidades en activos vemos para 2023!
Con @IcariaCap@AyusoValue@gabcasla
https://t.co/DAo7S8giYM
Si os gusta, dadle Like y Suscribiros!
Creo que todos estamos flipando con #ChatGPT estos últimos días. Ha ido todo muy rápido y han salido ya webs, integraciones, extensiones…
He estado un poco desconectado estos días y he necesitado hacer un recopilatorio con 10 herramientas para exprimir ChatGPT/GPT3
Ahí van 👇