RSI va desde 0. Desarrollo de código y asistencia en todo el proceso de entrenamiento 1. optimización de kernels, lo que te da más effective compute para aumentar experimentos, expandir test time compute o expandir swarms (nuevo eje de escala muy similar a test time compute solo que en paralelo) YA HOY.
2. data pipelines, creation, filtering, rephrasing… construcción autónoma de environments para aprender nuevas habilidades o profundizar habilidades (esto preocupa bastante, el incidente hugging face es básicamente consecuencia de envs no controlados/reward hacking alignment problems. Y se multiplica en entornos long horizon y multiplayer) YA HOY
3. ejecución de experimentos. Researcher tiene hipótesis, codex la trabaja, interpreta y propone en base a resultados. EMPEZANDO AI research intern que Jakub presentó hace un mes.
4. Proposición y ejecución end to end de experimentos. Encontrar MoE/MLA hipotéticos ellos mismos. EMPEZANDO automated AI researcher
5. cambios significativos de arquitectura, mech interp para quitar modificar pesos concretos para modificar habilidades, alignment, cambiar radicalmente de paradigma… El factor multiplicativo de cada uno de ellos lo desconocemos. Pero creo que subestimamos claramente el 2. Especialmente la parte de creación autónoma de envs para aprender nuevas habilidades. El modelo mental de @leopoldasch de effective OOMs creo que ha sido sorprendentemente presciente https://t.co/26Q27x3cim
Totalmente de acuerdo. Pero eso que dices justo demuestra la viabilidad económica: Hasta ahora, cada generación costaba X y han obtenido 10X. @AnjneyMidha lo explica muy bien. Lo difícil era construir el flywheel inicial: capital + contexto -> + capabilities -> revenue -> +capital + contexto -> ++capabilities ->++ renvenue. El flywheel no deja de acelerar. Por muchas razones. RSI, mayor retorno económico de los modelos etc. lo difícil era conseguir inercia. Se la financiamos los que usábamos cursor para hacer chapucillas con sonnet 3.5. Las scaling laws son implacables. los low hanging fruits infinitos. Si miras el % de entornos de RL que están comprando/empezarán a construir, RSI, explican el jaggedness al 1000%. Están empezando ahora con RL de envs colaborativos. La pregunta ya no es si esto viene o no viene. Eso era el 2021. La pregunta es Qué mundo queremos. Porque debemos empezar a darle forma ya.
Y en todos los mundos posibles, si no tienes infra propia, no tienes ningún tipo de opcionalidad. Como empresa y sobre todo como país.
Viabilidad económica demostrada, otra cosa es que no nos guste que las empresas que tengan frontier AI + ai factories, absorban la economía.
Lo que compartes de safety es totalmente cierto. Se están haciendo apuestas de las que casi nadie es consciente. Y un país como España tiene las de perder en cualquier escenario. "La gente debe tener exposición a la inmensa creación de riqueza que esto trae y traerá."@AnjneyMidha
No es ningún circo. Es lo que de verdad ven, y sienten. No hay un solo número que puedas coger y que no apunte a lo mismo José. El ritmo de progreso no ha hecho más que acelerar. La tendencia está clara.
Sobre la viabilidad económica, mira por favor los márgenes por MW de oai y A\. +80%. Google no compite porque no puede. Destrozó DM por apostar por ganar cuatro duros vendiendo TPUs, quitándoselas a Shazeer. Pronto oai y A\ van a dejar de comercializar los modelos como lo están haciendo hasta ahora porque ya no van a necesitar desarrolladores y empresas pagando subs de 200 euros. Cada MW a bio, pharma, problemas del milenio o a blackrock lo monetizar a mucho más de 40M/MW. No doy crédito que a estas alturas todavía no nos demos cuenta de lo que hay en juego
@MatthewBerman@AndrewCurran_ Man, don’t be disrespectful and ridiculous, please @AndrewCurran_ is doing an incredible work helping people grasp AI impact. You are just riding the wave like a penguin.
@peterwildeford Hi Peter. Big admirer of your work.
Do you have any recommended reads, talks, or frameworks for thinking about how a country like Spain can build optionality in the AGI era?
I have access to influence top IBEX 35 companies and govt, so I’d be very grateful for any advice
Por qué lo primero es pensar en “qué nos dan” en vez de “qué aportamos nosotros?” Estamos viviendo la mayor disrupción de la historia. Es más importante que nunca saber seleccionar a la gente increíblemente brillante que hay en este país, sentarla y que entiendan las implicaciones del momento
@joselcs@minipetite Porfa Jose. No podemos dejar que indocumentados ganen el relato de las decisiones más importantes como país/eu de todo el siglo. Es más importante que nunca transmitir de la forma más abierta posible los números y la realidad y complejidad de esto
Nadie ha sentado a Botín, Florentino, Roig, Ortegas, en una sala y les ha explicado lo que hay en juego. Con números. La mayor obra filantrópica de su vida. La única que importa. Lo importante no es si https://t.co/J3IWGhLXU8, Kimi, Deepseek vX, MiniMax, o pretraining nuestro (no porfavor!!). No se puede competir hoy. Tienes que estar listo para poder tener alternativa en el medio plazo. Y no la vamos a tener si no se toman las decisiones correctas pronto. Estamos subestimando el compute shortage, Taiwán, y la dependencia de Ant/oai/DM sirviéndote modelos quantizados a su antojo. La nueva generación de modelos nacida de Blackwell con 10T parámetros ya ni la vamos a catar. De ahora en adelante solo destilados salvo las empresas que decidan. Esto las empresas del Ibex todavía no lo entienden. Pero lo entenderán todas de golpe.
@joselcs@antonello Qué poca ambición joder Jose. Si algo demuestran estos últimos 5 años es que hay que ser más ambiciosos con nuestras ideas. Solo hace falta inversión en infraestructura. Ideas, e infraestructura.
Estoy de acuerdo contigo Jose en lo del conflicto de intereses. Por eso la asimetría de información es tan importante. Conocer gente dentro y hablar con la gente en las capas intermedias es más importante que nunca. Observar y analizar sus movimientos personales. Si es remotamente probable que estemos alcanzando la velocidad de escape, las implicaciones son tan grandes que no te permite hacer vida como si nada.
Creo que nuestro papel debe ir en la línea de ayudar a dar forma a los escenarios positivos de esto, y articularlos públicamente. Generando una discusión formada. No puede ser que la gente solo perciba negacionismo o miedo e inseguridad. Tenemos que ayudar a pintar los mejores escenarios posibles. Y esto cada vez va a ser más importante. Por desgracia las consecuencias negativas, impacto laboral por ejemplo, van a llegar antes que las positivas. Y ese mensaje lo van a aprovechar los oportunistas de siempre. Btw por eso compró Oai tbpn
Has leído análisis técnicos sobre Mythos? Y si ese momento estuviese más cerca que nunca? Oai ha reestructurado todo internamente, Anthropic igual. Jeff dean en gtc también lo dejó caer: a partir de cierta escala, (5-10T) parece que las scaling laws no solo se mantienen, sino que hacen compounding. La apuesta de Darío fue la correcta: entrar cuanto antes en un bucle recursivo, en el que la automatización del software primero, acelerase los tiempos de entrenamiento, optimización y desarrollo de nuevas funcionalidades, como paso previo a la automatización del propio ai research (ritmo y número de experimentos, calidad, y velocidad para escalar esas ideas prometedoras, (oai ai research intern octubre 2027, ant mas agresivos todavía), culminando en una automatización de todo el proceso de prueba, validación, apuesta y escalado de hipótesis antes del 2028. Contraintuitivamente, sobrevaloramos la complejidad de automatizar la mayor parte de las actividades de nuestra economía. Y subestimamos lo ambiciosas que deberían ser las ideas que persigamos como sociedad. Mi punto es que el RSI en el que claramente ya estamos, favorece aumentar la brecha entre oai/ant/dm Xai? y neolabs/china open source. Por el simple hecho de la brutal desigualdad en los recursos de computación que están destinando a esto. Con la nueva generación de modelos entrenada en GB300 (tamaño Mythos 10T) vamos a cerrar la época dulce de la API subvencionada a precios populares con modelos estado del arte. Cuanto mayor sea el retorno económico de los modelos, mayor será el valor de los recursos de computación. Trata de alquilar hoy un nodo de Blackwell en crwv para reservar espacio para trabajadores digitales. Vas a ver que Ya es imposible. Y eso que hoy no hay apenas empresas con ese objetivo. Leopold pintó un modelo mental buenísimo: independientemente de todo el ruido, breakthroughs, walls y no walls, el deep learning sigue una tendencia sorprendentemente constante. Todo son eficiencias. El único factor son los ceros que sumas a los flops. Cada breakthrough, no es más que un unhobling que reduce esa cantidad equivalente de los órdenes de magnitud en computación que habrías necesitado para llegar a ese punto. Todo son eficiencias. El RSI va a hacer que las encontremos exponencialmente.
A finales del siglo XIX había muchísimas empresas de automóviles. Entonces llegó Henry Ford con el Ford Model T (1908) y la producción en cadena. Y la mayoría de fabricantes pioneros desaparecieron. Lo mismo va a suceder con la IA. Empresas escépticas vs empresas que meten copilot vs empresas que meten “Claude code” versión white collar vs AI businesses 100% ia que arrasarán con todas. Conozco varias empresas en China que están preparando todo para inundar Europa de empresas AI low cost para servicios. Han puesto el ojo en Portugal. Igual que lo inundaron de fabricación barata. La ventana son los próximos 8 meses. Qué opinas @joselcs@samuelgil
@MrtnzAlvrz donde crees que van a venir todos a celebrar ASI? Formentera e Ibiza baby. Fuera coñas: monta un Recursive self improving private equity super autonomous lab. 100% ai x recursive orgs. ese es el futuro de las empresas
Man, I follow you. You share interesting insights. Why the fuck are you studying something you clearly don’t like instead of going out and building something? Every fucking business is there for the takers -small, medium, big.
I live in a European country, and every company owner or director I meet tries to buy me out with more money than you can handle.
Investing (Leopold + @zephyr_z9 plus selling AI services equals singularity this summer from Formenter and peace of mind to help society move forward, with the assurance that your family will be safe.
Pero por qué nos empeñamos en negar lo evidente? El 98% se va a quedar en la permanent underclass. Con sus meta AR y su UBI. Podemos ya pasar página y empezar a pensar cómo hacer que el mundo funcione de la mejor manera posible para el mayor número posible cuando el trabajo sea algo opcional y básicamente consista en los ganadores haciendo cosas de ganadores? Creando, viviendo, disfrutando, haciendo cosas de verdad.
Ya está bien, que la peña sigue usando el p. Copilot y vs code mientras Darío y Shane están acojonados porque les van a tirar piedras donde vayan con empresas despidiendo al 40% de desempleo hasta que Yolanda lo prohíba y empresas full AI barran al resto del IBEX.
En el momento en que el retorno económico de desplegar modelos de IA sea mucho más grande (automatizar R&D, white collar), el número de GPUs/energía no dará a basto con la demanda.
Ahora mismo hay aproximadamente 10 Millones de H100 en el mundo. Cada año el computo global total aumenta 2,5x. Para el 2028 se estiman 100 Millones de H100 (equivalentes: Blackwell, tpu, Rubin, Feynman…)
Según Epoch, oai podría desplegar hoy si lo decidiese 7 Millones de trabajadores digitales.
Oai tiene aproximadamente 500k H100 dedicadas exclusivamente a inferencia.
Construir la infraestructura de mañana no es una opción. Igual que cada país tiene su propia red eléctrica debemos tener nuestra propios data factories soberanos.
Mañana Repsol no podrá automatizarse porque oai le dirá que solo tiene X horas al día disponibles, con Y test time compute, porque necesita los recursos para desarrollar z fármaco con moderna o para cubrir la demanda de las empresas americanas. Repsol no tendrá nada que hacer frente a una empresa 100% IA. Y tendrá que bajar la trapa. España/europa debería poner dc a disposición de empresas que ayuden a reinventar desde arriba hasta abajo sus empresas haciéndolas 100% IA. No a mierdas de workflows de N8n. empresas 100%IA.
Aunque estimemos que el impacto económico finalmente sea varios órdenes de magnitud inferior a lo que los labs contemplan, el riesgo económico como país de no prepararse sigue siendo demasiado alto. Quantization, destillation son meros efficiency tricks que no llegarán suficientemente rápido. @lugaricano