Introducing CleanShot 5.0 ✨
The new Studio Mode is all you need to turn a simple screen recording into a polished, professional video - with the quality you expect from CleanShot.
Available now on all plans. No subscription required.
DeepSeek-V4-Flash-0731: mismo modelo de abril, misma arquitectura (284B totales, 13B activos), cero parámetros nuevos.
Solo repitieron el post-entrenamiento con énfasis agéntico y pasó de 61.8 a 82.7 en Terminal-Bench 2.1, confirmado por Cline. A 14 centavos por millón de tokens de entrada.
En el video: cómo funciona el pipeline de "diez profesores, un alumno", qué cifras son del vendedor y cuáles vienen de mediciones independientes, y los seis puntos flojos reales (verbosidad de 210M de tokens para completar el índice de Artificial Analysis, 84% de alucinación en AA-Omniscience, sin visión, tool_choice que devuelve error 400 en modo thinking, bugs en vLLM y SGLang, y datos almacenados en China).
La conclusión que me parece más relevante para 2026: buena parte de las ganancias de capacidad ya no viene de escalar parámetros.
👉 https://t.co/WeBWEMqKBt
Bajan los precios de la API de ElevenLabs y duele menos meter voz en producción:
- Text to Speech: hasta 55% más barato (Flash pasa de $0.11 a $0.05 por 1K tokens)
- Speech to Text: hasta 45% menos (Scribe v2 de $0.40 a $0.22)
- Agentes de voz: 20% menos ($0.08 por minuto)
Y ahora hay pay as you go, sin compromiso anual.
GLM-5V-Turbo apuesta por algo poco común: un modelo multimodal donde la percepción manda. La tesis del paper es clara - la mayoría de fallas "de razonamiento" empiezan porque el modelo no vio bien la imagen. Encadena tools (crop, zoom, anotación, lectura web) y se integra como controlador visual en Claude Code.
Pasar tests no es refactorizar bien.
El nuevo Refactoring Leaderboard de Scale muestra que los agentes dejan código muerto, imports viejos y lógica duplicada incluso cuando los tests pasan en verde.
Claude Code con Opus 4.7 lidera, seguido de Codex con GPT-5.5. Las tareas exigen el doble de líneas modificadas que SWE-Bench Pro y 1.7x más archivos editados.
👉 El dato que más me interesa: en 3 intentos, los modelos tienen 2-3x más probabilidad de acertar una vez que de acertar las tres. Capacidad pico ≠ confiabilidad.
Codex ya vive dentro de Chrome en macOS y Windows. Trabaja en paralelo entre pestañas, en segundo plano, sin secuestrarte el navegador.
Lo interesante: escribe y ejecuta código para navegar. Si necesita un sitio con sesión iniciada, usa Chrome; si basta un plugin, lo elige. El navegador se vuelve runtime de agentes.
Anthropic logró traducir las activaciones internas de Claude a texto legible. Y lo que aparece ahí es interesante: en pruebas de seguridad, el modelo "sabía" que estaba siendo evaluado aunque nunca lo dijera en voz alta. Pensar en números deja huellas.
ZAYA1-8B: 760M parámetros activos (8.4B totales) y le pelea de tú a tú a DeepSeek-R1 y Claude 4.5 Sonnet en matemáticas. Pesos abiertos bajo Apache 2.0, entrenado completo sobre AMD MI300X.
La densidad de inteligencia por parámetro está empezando a importar más que el tamaño bruto.
🔗 Fuente: https://t.co/KsYZCsJ1n1
OpenAI liberó MRC, un protocolo de red para clústeres de entrenamiento que ya corre en sus supercomputadoras más grandes, incluida la de Abilene con Oracle y los Fairwater de Microsoft.
Lo soltaron al Open Compute Project con AMD, Broadcom, Intel, Microsoft y NVIDIA. Traducción: menos GPUs paradas esperando paquetes.
GPT-5.5 Instant entra como default en ChatGPT y como gpt-5.5-chat-latest en la API.
El número que importa: 52.5% menos alucinaciones en prompts de medicina, derecho y finanzas frente a 5.3 Instant.
Que el modelo barato sea el que mejora en factualidad dice más del roadmap que cualquier benchmark.
Anthropic se queda con toda la capacidad del data center Colossus 1 de SpaceX: +300 MW y más de 220 mil GPUs NVIDIA en menos de un mes.
Traducción para quien usa Claude Code: límites de 5 horas duplicados en Pro, Max y Team, y se acabó el recorte en horas pico. La API de Opus también respira.
Plantillas de agentes Claude listas para finanzas: armar pitches, revisiones de valuación, cierre contable de mes. Se instalan como plugins en Cowork y Claude Code, cada uno con sus conectores, skills y subagentes.
Es el patrón que se viene: agentes empaquetados por vertical, no chatbots genéricos.
🔗 Fuente: https://t.co/HP4aW6GMp6
Renderizar video con HTML, CSS y GSAP, salida MP4 determinista, pensado para que un agente lo escriba. Eso es HyperFrames, ahora con playground público y `npx hyperframes publish` para subir tu proyecto y que otro lo bajen como zip y lo remixeen.
14.3k stars en GitHub no salen de la nada.
GPT-5.5 Instant ya está rolando como modelo por defecto en ChatGPT. El número que importa: 52.5% menos alucinaciones en prompts de alto riesgo (medicina, derecho, finanzas) vs GPT-5.3. Menos relleno, más respuestas que se sostienen.
Remotion ya trata HTML-in-canvas como primitiva de primera clase. Esto significa poder meter un DOM vivo dentro de un canvas y aplicarle efectos tipo glitch con WebGL o Canvas 2D, algo que antes implicaba hacks horrendos.
El detalle: para previsualizar necesitas Chrome Canary con un flag. El render final funciona sin configurar nada.
Apareció un modelo anónimo llamado Peanut en el #8 del ranking de text-to-image de Artificial Analysis. Lo interesante: prometen liberar pesos pronto. Si se cumple, sería el mejor modelo open weights de generación de imágenes, por encima de FLUX.2 [dev], Qwen-Image y Z-Image Turbo.
Unity AI entra en beta abierta para Unity 6 con tres piezas: un agente integrado al editor, un AI Gateway para conectar tus propios modelos y un MCP Server propio que promete ser más rápido que las alternativas open source.
La apuesta es clara: que no te cases con su agente si no quieres.
GPT-5.5 saca 0.43% en ARC-AGI-3. Opus 4.7, 0.18%.
Lo interesante no es el número, es el patrón: los modelos detectan el efecto local ("si aprieto ACTION3, esto rota") pero no construyen el modelo del mundo que conecta esa rotación con el objetivo del juego.
Ven la causa, no entienden la regla.
ElevenLabs soltó un Voice Changer Skill: cambias la voz de un audio pero te quedas con la actuación, la emoción y el timing del original.
Se instala con un `npx skills add elevenlabs/skills` y queda enchufado a tu agente.
El doblaje sin actores deja de ser ciencia ficción.