@imnotchalk genuine question tho, 10M tokens of what? if it took 10M to ship something a better model does in 500k, the limit isn’t the interesting number. output/token is the metric, not tokens
@myrrakle Había leído un estudio que confirmaba que sí, que es más eficiente que sea en inglés. No tengo el link a mano, pero estuvo dando vueltas hace un par de semanas
@MartinPulitano Vengo usando Sol a diestra y siniestra y se nota un cambio gigante versus lo que venia siendo GPT. A día de hoy, y para los usos que le doy, sí, ChatGPT vuelve a estar arriba. Ni hablar de lo bien que funciona Codex en iOS.
@AnthropicAI publicó las nuevas reglas de context engineering para los modelos generación 5, y el dato de apertura lo dice todo, borraron más del 80% del system prompt de Claude Code para modelos como Opus 5 y Fable 5, sin pérdida medible en sus evals de coding.
El hallazgo es que estaban sobre-restringiendo al modelo. Leyendo transcripts de su propio uso interno encontraron mensajes en conflicto dentro de un mismo request el system prompt diciendo "NO escribas comentarios" mientras el usuario pedía documentación y el modelo gastaba razonamiento resolviendo esos choques antes de trabajar.
Las prácticas que ya son mitos, según ellos mismos.
Darle reglas → dejar que use su juicio. Antes: "default a cero comentarios, nunca docstrings multi-párrafo". Ahora el prompt dice: "escribe código que se lea como el código existente, iguala su densidad de comentarios, naming e idioma".
Darle ejemplos de tools → diseñar interfaces. Los ejemplos limitan el espacio de exploración del modelo. Lo que funciona es diseñar parámetros expresivos: un enum de pending/in_progress/completed ya le insinúa al modelo cómo usar la tool sin dictárselo.
Meter todo upfront → progressive disclosure. Verificación y code review salieron del system prompt y se volvieron skills que el modelo carga solo cuando las necesita. Igual con tools de carga diferida que no ocupan contexto hasta usarse. Aplica a tu CLAUDE.md: en vez de una biblia central, un árbol de archivos que se cargan en el momento correcto.
Repetir instrucciones → descripciones simples. Los modelos viejos necesitaban instrucciones repetidas al inicio y al final del contexto. Ya no: la instrucción va una sola vez, en la descripción de la tool.
Memoria manual en CLAUDE.md → auto-memory. Claude ahora guarda solo lo relevante, sin el hotkey #.
Specs simples → referencias ricas. En vez de markdown plano: test suites como spec, mockups HTML (rinden mejor que descripciones o screenshots), artifacts, y rubrics para que agentes verificadores apliquen tu criterio.
La recomendación práctica, CLAUDE.md liviano, gastando los tokens en los gotchas del codebase, no en lo obvio que Claude puede ver solo. Y soltaron /doctor en Claude Code, que te adelgaza skills y CLAUDE.md automáticamente.
En conjunto, el mejor harness ya no es el que más controla al modelo, es el que menos le estorba.
@ClaudeDevs@claudeai
Opus 5 is a great model for coding, data analysis, design, biology, knowledge work.
More than any of these eval scores, what is most exciting to me is something else: Opus 5 is our least prompt injectable model yet. It is a bit buried in the system card, but across PI evals and red teaming, Opus 5 is very hard to prompt inject successfully.
And when layering defenses -- strong model alignment, combined with prompt injection probes, combined with Auto Mode in Claude Code -- the success rate for prompt injection attacks drops to ~0. This is new and exciting! More about this soon.
https://t.co/Tc7z2FqJhQ
Keep work across multiple folders in one Codex project.
Local projects can now include related code, docs, and reference files from multiple folders. Codex can read and write across them while one primary folder remains the Git root.
Claude Code on desktop now works with the iOS simulator.
Build and run your iOS app, and the simulator opens in a panel right next to your conversation. Available today in public beta.
The computer is being reinvented in the agentic era:
- The model is the new CPU.
- The harness is the new OS.
- Hallucinations are the new bugs.
- The context window is the new RAM.
- Skills are the new apps.
- Markdown files are the new config.
- Evals are the new QA.
- Context is the new moat.
- Permissions are the new firewall
- Trust is the new bottleneck.
- Prompt is the new programming language
- Agent is the new software.
Anything you dream of, you can build.
This is the greatest time ever to be building with computers.