@Ivn_unalcoyano El riesgo es exponencial y la diferencia en tiempo escasa si es un trayecto corto. No compensa. En trayectos muy largos ir algo más rápido se nota más, pero es absurdo en el día a día ver a gente hacer temeridades para pararse en la siguiente rotonda/semáforo...
El COO de Uber reconoce que está siendo difícil justificar el dinero usado para la IA.
"Un mayor uso de tokens no se traduce en un aumento de funcionalidades útiles para los consumidores"
Han quemado en 4 meses TODO el presupuesto de 2026 para el uso de IA
Yann LeCun says LLMs are strongest in domains where language itself is the substrate of reasoning, like math and code
They can solve problems, prove theorems, and write programs — but they are not creative mathematicians, software architects, or computer scientists
"their role is to help humans build"
La primera parada para repostar de la historia.⛽
Se quedó sin combustible… e inventó las gasolineras en 1888, así, sin más. 😎
Feliz 177º cumpleaños, Bertha Benz, adelantando a todo el mundo desde 1849. 🚗
#BerthaBenz#MBClassic
Son herramientas, tecnología, y ninguna herramienta/tecnología es infalible. Sin criterio pueden ser contraproducentes y/o peligrosas. Si las usáis hacedlo con lógica y revisad resultados.
Researchers at EPFL proved your AI is lying to you.
Not sometimes. Most of the time.
They built one of the hardest hallucination tests ever made with Max Planck Institute. 950 questions. Four domains where being wrong actually hurts. Legal. Medical. Research. Coding.
Then they ran every top model on it.
The results.
GPT-5. Wrong 71.8% of the time.
Claude Opus 4.5. Wrong 60% of the time.
Gemini 3 Pro. Wrong 61.9% of the time.
DeepSeek Reasoner. Wrong 76.8% of the time.
These are the smartest AI models on Earth. The ones you trust with your career. Your health. Your money.
You think turning on web search fixes it.
It doesn't.
Claude Opus 4.5 with web search. Still wrong 30.2% of the time.
GPT-5.2 thinking with web search. Still wrong 38.2% of the time.
The internet attached. Still lying to you in 1 out of every 3 answers.
Now the part that should scare you.
Medical questions. The one place being wrong can kill you.
GPT-5 hallucinated 92.8% of the time on medical guidelines.
Claude Haiku 4.5 hallucinated 95.7% of the time.
Gemini 3 Flash hallucinated 89% of the time.
Nine out of ten medical answers from popular AI models. Wrong.
It gets worse.
The longer you talk to it, the more it lies.
Early mistakes cascade. The model starts citing its own earlier hallucinations as facts. Your third message is more wrong than your first.
The paper, in its own words: "hallucinations remain substantial even with web search."
This is what hundreds of millions of people are doing right now. Asking software that lies in the majority of its answers. About their health. About their job. About their legal case. About their code.
Most are not checking.
Most never will.
But please. Keep using ChatGPT for medical advice.
The doctors need a break.
https://t.co/dHBP5CDpTM
@elchicomorera@XavierLara23@DotCSV @Delachica_ Efectivamente, porque a mí sí que me interesa el cómo. Pues no me he pasado yo años viendo los making off o entrevistas a los creativos, viendo los bocetos iniciales y todos los 'detrás de las cámaras'. Para mí es una parte inseparable del resultado. De nuevo, para mí
@jagaraviles Lo peor es cuando hay asociaciones culturales que pueblan sus reportajes con imágenes generadas, se nota mucho, queda cutre y le quita el valor a la palabra 'cultural'.
@cafedomar2020@Pedro_Torrijos Aquí tienes a uno que lleva en esto de la IA unos 50 años diciéndote lo mismo; que no es inteligente: https://t.co/0LoCEzK6CV
Otra cosa es que lo que te diga el CEO de una empresa. Es importante no confundirlos.
La gente que sabe *de verdad* de inteligencia artificial lleva diciendo esto desde bastante antes de que los LLMs fuesen populares.
De hecho, la gente que sabe *de verdad* de inteligencia artificial afirma que aún faltan entre 50 y 100 años para que cualquier sistema artificial llegue al nivel de inteligencia de un perro.
Otra cosa es que simule que es inteligente o que sus capacidades sean sobresalientes, pero eso no es inteligencia.
Google DeepMind researcher argues that LLMs can never be conscious, not in 10 years or 100 years.
"Expecting an algorithmic description to instantiate the quality it maps is like expecting the mathematical formula of gravity to physically exert weight."
@InvIngeniero Ahora mismo los alquileres son más altos que las hipotecas. Además con la hipoteca pagas siempre lo mismo al mes, o menos si amortizas. El alquiler te lo van a subir todos los años.
En 30 años de alquiler vas a pagar lo que valen dos casas. Y todo eso, sin tener casa.
Es fantástico leer a alguien que habla con los pies en la tierra, dejando a un lado el hype y las locuras que estoy leyendo a compañeros de sector estos días. Muy recomendable. Lo mejor que os puedo decir: no os creías titulares, id un poco más allá.
ahora que han pasado unos días desde la "presentación" de Mythos y os habéis calmado, vamos a revisar que es lo que ha pasado exactamente.
Anthropic saca Mythos, su nuevo modelo. Ahora ya si que si, AGI. Esta vez si que si de verdad de la buena. Los devs desaparecerán en 6 meses. 99999999% en SWE Benchmark Ultra Hyper Difficult. Es un cuatrillón de veces mas mejor que Slopus 4.6. Novecientos ochenta y cuatro gaziliones de parámetros. Ha encontrado vulnerabilidades en todos los proyectos. Dario está tan aterrorizado que ha decidido no sacar el modelo al público (de momento). Efectivamente, es game over. dep en rip en paz, el shur de forocoches tenían razón.
¿O no?
Vamos por partes.
"Es que este modelo es tan brutal que no lo vamos a sacar al público porque va a colapsar el mundo".
Durísimas declaraciones. Ya las hemos escuchado antes. Mas de una vez.
En su momento Dario era el vicepresidente de investigación en OpenAI. Y ya hacía las mismas afirmaciones allá por el 2019. Literalmente. OpenIA dijo exactamente lo mismo, palabra por palabra, para GPT-2.
https://t.co/US79iN6rHC
Hay que entender la situación general para saber el por que de estas declaraciones. A lo mejor habéis leído algo de que Anthropic factura unos cuantos billones.
Son cifras "anualizadas".
¿Que significa anualizadas?
Significa que han cogido el periodo mas bonito en términos fiscales (ej el mes que mas facturación tenían porque han cerrado varios contratos muy grandes) y han multiplicado por 12.
Ta-ta-ta-chaaaaaaaannnnnn...
Pero en el mundo real, si yo tengo 10 clientes y les facturo 1000€ anualmente, y da la casualidad de que a todos les facturo en Enero, eso no significa que mi facturación anual va a ser 1000€ * 10 * 12.
Pos ea. Un truqui que habéis aprendido. Pero volvamos al tema.
Anthropic necesita dinero. Mucho dinero. Muchisimo. No os hacéis una idea del pozo en el que están metidos (ellos, OpenIA y todos los demás jugadores). Necesitan tanto dinero que literalmente la economía yanki (y por extensión, la del resto del mundo) está aguantando la respiración para ver que ocurre, porque como esto pete lo del 2008 va a ser una tarde de relaxing cup of café con leche en la plaza Mayor.
¿Y que hace cualquier empresa grande que necesita dinero y que ya va por la ronda G de financiación y el stock está mas diluido de unas gotas homeopáticas?
Una IPO. Pronto. A finales de este año, por ejemplo.
Pero para la IPO necesitan crear expectativas. Necesitan hypear a la gente. Necesitan que se hable de Anthropic.
No lo estoy explicando bien. Lo intento de nuevo.
Dario tiene el *deber fiduciario* (responsabilidad legal) de hacer absolutamente todo lo posible para que la IPO salga de tal manera para maximizar el beneficio económico de los inversores. Y obviamente si a pocos meses de la IPO sacan un modelo que es el game over de todo y para todo, pues... stock go brrrr, expectativas go brrr, IPO go brrrr, Dario go brrrr.
Ahora que entendemos la motivación legal y económica de Dario, vamos a analizar el anuncio en sí.
https://t.co/crshws1eKJ
> el modelo es tan avanzado que encuentra vulnerabilidades en todos los proyectos a los que se le ha dado acceso: ffmpeg, firefox, openbsd, el kernel de linux
> y por esa misma razón, prefieren guardarlo bajo llave de momento y darle acceso solo a unas cuantas empresas (que, asumo, lo usarán para buscar vulnerabilidades en sus propios productos y parchearlos)
Nice. Very nice. Impressive.
"Veamos ahora con los modelos que ya tenemos!"
Llega AISLE, una empresa que se dedica a la cyberseguridad, y empieza a hacer preguntas. ¿pero este ejercicio cuanto ha costado? ¿se puede replicar? ¿se puede replicar con otros modelos? ¿cual es la severidad real de esas vulnerabilidades?
https://t.co/pa0N490Qoa
Oh boy... se va a liar...
Pues resulta que de los 8 modelos que probaron, 8 pudieron detectar el mismo fallo que Mythos detectó en openbsd.
Ídem con otro fallo de nfs en freebsd.
AISLE no refuta que Mythos no sea bueno, que lo es. Lo que refutan es que presente un peligro como el que Anthropic intenta hacer entender. Es decir, AISLE demuestra que lo que Anthropic afirma de Mythos ("puede buscar y encontrar vulnerabilidades en proyectos") ya lo hacen otros modelos. Y lo hacen igual de bien.
También es cierto que AISLE es una empresa que se dedica a buscar vulnerabilidades con su sistema de IA. Podríamos argumentar que está en su interés desacreditar las afirmaciones de Anthropic.
Vamos a ver que opinan otras personas.
Yann LeCun (vicepresidente y científico jefe de IA en Meta): "el drama de Mythos son tonteías producto del autoengaño"
https://t.co/qlazOsMDnf
Dawid Moczadlo (cto de vidoc security): "llevamos meses encontrando vulnerabilidades en el kernel de linux usando otros modelos. Puede que Mythos sea mejor (que los modelos actuales), pero no es ni de lejos la amenaza que Anthropic hace creer"
https://t.co/hZ1voRRl8y
George Hotz ("geohot", hacker, famoso por sus jailbreaks de ios y ps3, founder de tinygrad): "encontrar 0days no es tan difícil. No aparecen 0days todos los días porque nadie quiere mirar. Encontrar fallos en el código de mierda de la gente (y lucrarse por ello) es ilegal y los criminales no suelen tener mucha habilidad; de tenerla, no serían criminales"
https://t.co/0E0Y7zcTMT
Y aquí voy a permitirme hacer un +1 de geohot. Encontrar 0days no es tan difícil. Yo he encontrado unos cuantos (chungos de cojones; https://t.co/EmWvmL9KsN) y la ciberseguridad no es ni de lejos mi área principal. El problema es que encontrar vulnerabilidades no solo no es lucrativo, sino que en España es ilegal (https://t.co/ky6N50ZZYh) y corres el riesgo de meterte en un buen marrón incluso aunque tus intenciones sean buenas. Obviamente si tus intenciones son lucrarte vendiendo 0days, olvídate de hacerlo legalmente.
Y este es el punto de Geohot. No salen 0days todos los días porque nadie tiene el incentivo de buscarlos, no porque realmente sean tan difíciles de encontrar.
Anyways, que nos desviamos del tema.
¿A donde quiero llegar con todo esto? ¿Que significan todas estas cosas?
Significan que no os lancéis a la primera afirmación que suelta alguien. Y menos en este campo en particular, en estos últimos 3-4 años. Es muy probable que os estéis comiendo una (otra más) bola de hype. Hay muchísimos intereses ocultos (y no tan ocultos) y hay muchísimas maneras de decir las verdades a medias para pintar escenarios que dan a entender cosas que no son.
¿Pero todo esto quiere decir que Mythos no va a ser bueno? Obviamente no. Mythos será mejor que Opus (o eso espero, vaya). Pero Mythos no va a ser el fin de los tiempos. No se va a acabar el mundo.
Resumiendo, solo os pido que no caigáis (una vez más) en el "ahora ya si que si".
La pública siempre es mejor, y gracias a ella sigo aquí, eso que quede claro. Pero no quita que necesite acceder a algunas cosas privadas para poder avanzar en la pública
@AlejoRofer@Alvaro95barco Donde yo vivo hay muchas cosas que sin coche no podrías hacer. Tendrías como mínimo que alquilar uno, osea, que sin él hay cosas a las que se renuncia. Y está bien, no todos tenemos las mismas necesidades e inquietudes, pero no hay que negar la realidad.
Los viajes espaciales no son como en Star Trek donde el timonel del Enterprise “apunta” a su planeta de destino y luego acelera en línea recta.
La realidad es mucho más compleja. La Artemis II no va a la Luna, va a donde estará la Luna.
Os lo explico de forma sencilla en este
🧵 HILO lunar
@monkibleh@drizzt__dourden Por ejemplo desplazarte a buena parte del mundo rural de este país, y ya ni hablemos de hacerlo a determinadas horas. Las opciones son escasas (a veces no hay directamente) y los horarios extremadamente limitantes. A mucha gente le dará igual no ir por allí, a mí pues no tanto...