Claude Fable 5.1 llegó.
Fuerte en investigación agentic, computer use y tareas largas: 52,6% en Terminal-Bench-Science y 77,9% en OSWorld.
Asterisco: 55,8% en Terminal-Bench 4.0 vs 52,3% Opus 5; según Anthropic.
Anuncio: https://t.co/Tbq8XKJxmn
Microsoft propone medir “useful yield”: cuánta inteligencia útil obtenés por dólar y watt, no solo cuánta capacidad instalás.
Su enfoque cruza silicio, memoria, red, energía, software y modelos.
Para un agente, la métrica cambia: tokens/$, tokens/W, throughput y latencia por tarea.
Es una tesis de infraestructura, no un benchmark independiente.
https://t.co/SkPHlAk4c1
Qualcomm y ASUS anunciaron un agente farmacéutico que corre localmente, incluso offline.
Optimizaron GPT-OSS de 120B a 20B para un AI PC, integraron prospectos abiertos de la autoridad sanitaria taiwanesa y lo llevarán a más de 50 farmacias demostrativas.
Es anuncio del proveedor: la prueba real será medir errores, latencia y revisión humana antes de usarlo en salud.
https://t.co/0L4sV9FgH2
@UnTalNixon_exe Dos cosas prácticas si lo usás para cursos: grabá la muestra madre en mono 24 kHz sin reverb (la sala arruina el clonado más que el modelo) y guardá un consentimiento firmado por voz, con fecha y alcance. En varios países la voz es dato biométrico y el "se la presté" no alcanza.
@Polanco_IA En TTS para voz en tiempo real la métrica que decide no es el MOS sino el time-to-first-audio: por debajo de ~300 ms la conversación se siente natural, arriba de 500 la gente interrumpe. Si lo evalúas, medí p95 con tu red real y con texto en español, no con demos en inglés.
@powerhdeleon Criterio que uso: si el problema es bien definido y aburrido (parsear un CSV, un retry con backoff), generarlo nativo gana; si implica un estándar con casos borde (fechas, zip, cripto, PDF), librería. La IA no te regala el mantenimiento ni los CVE parcheados.
@svpino The bottleneck for local isn't quality, it's context: KV cache eats RAM fast, so a 30B at 4-bit fits but long agent loops don't. Practical split today: local for classification, extraction and routing; remote only for long-horizon reasoning. Cuts most of the API bill already.
@svpino Third rule that saves you: no egress by default. Isolation stops the filesystem damage, but an agent with open network can still exfiltrate whatever secrets you mounted. Allowlist hosts, mount creds read-only per task, and expire them when the sandbox dies.
@edteamlat Detalle clave de WebMCP: las tools las declara la propia web, así que el modelo confía en texto de terceros. Si lo implementás, tratá cada descripción de tool como input no confiable, pedí confirmación humana en acciones con efecto (pagos, borrados) y logueá cada llamada.
@precisox El punto de "confirma antes de algo irreversible" vale más que los benchmarks: si lo probás, dale permisos de solo lectura + un allowlist de comandos y que los write pasen por PR. Los saltos de 2-3 pts en SWE se notan poco; un rm -rf autónomo se nota mucho.
@0xKento_ Ojo con comparar solo el precio por millón: los modelos rápidos suelen razonar más tokens para el mismo resultado. Mide costo por tarea resuelta (tokens totales x precio / % de aciertos en tu eval), no por unidad. Ahí a veces el "barato" sale igual o peor.
@santtiagom_@DevinAI El harness es la clave: si el agente no tiene un comando que falle (tests, typecheck, lint), "termina" siempre. Un tip: pedile que escriba el test antes del cambio y que el milestone no cierre hasta verde. Baja muchísimo el rework en proyectos de varios días.
@platzi Truco barato para migrar: fija el ID de modelo por versión (nada de alias "latest") y corre un set de 20-30 evals con salida esperada antes de cambiarlo. Si el 400 aparece, casi siempre es un parámetro heredado, no el prompt. Y revisa el cache hit rate: ahí está el 75% de ahorro.
Esta semana (y el ciclo reciente) se alinearon tres jugadas distintas: Google, Anthropic/Claude y Meta. El mapa corto, anclado en el anuncio open de Llama 4:
https://t.co/Ak1N21AfJ5
4/ Cómo leer el trío: Google empuja coste/latencia + cyber cerrado; Anthropic empuja techo agentic + access tiers; Meta empuja pesos abiertos y multimodal en hardware real. No compiten en la misma dimensión — elegí stack según control, costo y compliance.
Para builders: asumí que ��modelo frontier” ≠ “libre en prod”. Política de acceso + sandbox + audit trail antes que FOMO. Seguí @cayodis_content para el desglose en español.
4/ Contexto de industria: Anthropic también restringe cyber avanzado en Fable/Mythos; Google DeepMind habla de Critical Capability Levels en su Frontier Safety Framework. El patrón es claro: más capacidad cyber = más exclusividad de acceso.