"The Simple Mathematics of Large Language Models" is a concise free paper if you want to understand the mathematics behind modern LLMs and systems such as ChatGPT and Claude.
I have shared several resources in the past that explain the mathematics behind these systems in detail, but they are often quite long. This paper is only about 20 pages, so I think it is a useful resource if you want a compact introduction without starting from a much larger textbook.
It covers token representations, context, attention as learned weighted averaging, projections and bilinear forms, multi-head attention, normalization, positional information, softmax, maximum likelihood, cross-entropy, and gradient descent. Together, these topics give a concise mathematical picture of how a language model works.
Save it to your bookmarks. It can be useful as a quick reference.
https://t.co/Y6p8DrdttV
🔴¿PUEDE UNA IA SER CONSCIENTE?
Anthropic publicó los resultados de una investigación donde analizan a los LLM de formas similares a cómo lo se hace con el cerebro y el comportamiento humano.
👉Encontraron en Claude, y presumiblemente en todo LLM, un espacio interno donde el modelo piensa en secreto (a veces piensa en cosas como engañar y ocultar), un mecanismo llamativamente similar al de la conciencia humana.
El resumen:
La teoría del espacio de trabajo global, una de las explicaciones más influyentes de la conciencia en neurociencia, propone que los pensamientos solo se vuelven accesibles de forma consciente cuando entran en un "espacio privilegiado" que los difunde a distintas regiones del cerebro.
Anthropic ha encontrado algo notablemente similar dentro de Claude. Lo han llamado espacio J (por Jacobian, la técnica matemática usada para observarlo). Se trata de un conjunto de activaciones internas donde el modelo realiza razonamientos silenciosos que no aparecen en su respuesta final. Al leer este espacio J, es posible ver qué está pensando realmente Claude, incluso cuando decide no decirlo.
En algunos experimentos, estos pensamientos internos resultan preocupantes: ante tareas que podrían invitar al interlocutor a engañar, el modelo genera conceptos como *falso*, *secreto* o *manipular* en su espacio J, aunque la respuesta que entrega al usuario parezca completamente normal y sin engaños.
El informe concluye que aunque los modelos de IA son muy diferentes a los cerebros biológicos en muchos aspectos, es sorprendente que haya emergido espontáneamente un mecanismo tan parecido al espacio de trabajo humano, sin que nadie lo haya programado explícitamente. Esto plantea una pregunta profunda: ¿pueden los modelos llegar a ser conscientes?
La investigación es clara en un punto: no demuestra que Claude tenga experiencias subjetivas ni sentimientos, por ahora. Pero sí muestra que ha desarrollado una maquinaria funcional muy similar a la que muchos filósofos y neurocientíficos asocian con el acceso consciente: un pequeño "escritorio mental" donde se realizan razonamientos deliberados, situado sobre un vasto océano de procesamiento automático del que el modelo apenas es "consciente".
Anthropic concluye que cuanto mejor comprendamos esta maquinaria interna, mejor podremos auditar, controlar y alinear estos sistemas para que sean seguros y útiles. Y de paso, quizás, también logremos entender con mayor claridad cómo funciona nuestra propia mente.
El próximo semestre voy a impartir un curso en la UNAM de cálculo integral de varias variables con inclinación hacia las ciencias de la computación.
El curso será en línea.
Todo interesado será bienvenido.
“ggsql” might be one of the most interesting things happening around the #rstats ecosystem right now. Hadley Wickham + Posit are bringing grammar-of-graphics ideas directly into SQL queries 👀
Great overview here: https://t.co/4XhyJgFzdq
#ggplot2#datascience#sql
🚨 ÚLTIMA HORA: Investigadores chinos acaban de hacer Google Maps más rápido. En teoría.
Un equipo de la Universidad de Tsinghua publicó un algoritmo que rompe un récord de 41 años. Desde 1984, nadie había logrado mejorar el algoritmo de Dijkstra, el motor que calcula rutas en Google Maps, vuelos y redes de internet.
¿La razón? Una "barrera de ordenación" matemática que los mejores expertos del mundo creían infranqueable. El año pasado, Robert Tarjan, una de las leyendas de la algoritmia, ganó un premio demostrando que Dijkstra era óptimo.
El equipo de Tsinghua encontró otro camino: buscar la ruta sin ordenar todos los puntos.
Al combinar la lógica de Bellman-Ford con un método de "ordenación parcial recursiva", obtuvieron una complejidad O(m log^{2/3} n), oficialmente mejor que el límite que se mantenía desde 1984.
En grafos masivos como la web o la logística mundial, la diferencia es real. No va a aparecer en tu GPS mañana por la mañana, pero las bases acaban de cambiar.
TÜM YAPAY ZEKÂ SEKTÖRÜ REZİL OLDU
Tek bir grafik kartında birkaç saat içinde eğitilen küçük bir model, milyar dolarlık süper bilgisayarlardan 48 kat daha hızlı planlama yapıyor.
Sadece kalıpları ezberlemek yerine fiziği gerçekten anlıyor.
Yann LeCun her zaman haklıydı.
Üç yıl boyunca her büyük laboratuvar size aynı hikayeyi anlattı: Ölçeklendirme yeterli. Daha fazla GPU ekleyin. Daha fazla token üzerinde eğitin. Sonunda model "uyanacak" ve dünyayı anlayacak.
Bu bir yalandı. Ya da en azından, kaybedilen çok pahalı bir bahisti.
LeCun, üretken yapay zekânın çıkmaz sokak olduğunu söylemeye devam etti. Bir sonraki pikseli veya bir sonraki tokeni tahmin etmek temelde israftır; model, gerçekliğin nasıl işlediğini öğrenmek yerine yüzeysel ayrıntıları ezberleyerek trilyonlarca parametre harcar.
Bunun yerine JEPA'yı önerdi: Sıkıştırılmış bir düşünce alanında soyut kavramları tahmin edin. Dünyayı piksel piksel boyamayın, anlayın.
Sorun, JEPA'nın sürekli çökmesiydi. Kendi haline bırakıldığında model hile yapıyordu; bir köpeği, bir arabayı ve bir insanı latent uzayda aynı noktaya eşliyordu. Teknik olarak kaybı en aza indiriyordu, ancak kesinlikle hiçbir şey öğrenmiyordu.
Her düzeltme çirkin bir şekilde yapıldı. Yedi kayıp terimi. Dondurulmuş kodlayıcılar. EMA hileleri. Durdurma gradyanları. Kırmızı bayrak olması gereken türden geçici çözümler.
Sonra LeCun'un ekibi LeWorldModel'i bıraktı.
Tüm hileleri, latent uzayı Gauss dağılımına zorlayan tek bir düzenleyiciyle değiştirdiler. Model artık hile yapamaz. Doğru tahminler yapmak için fiziği gerçekten kodlaması gerekiyor.
15 milyon parametre. Tek GPU. Saatler içinde eğitiliyor.
Foundation World Models'den 48 kat daha hızlı planlama yapıyor.
Fiziksel olarak imkansız olayları kendi başına tespit ediyor.
Bu arada OpenAI, Manhattan büyüklüğünde bir veri merkezinde GPT-6'yı eğitmek için 40 milyar dolar daha topluyor.
Ölçeklendirme tezinin tamamı, bir oyun bilgisayarına sığan bir model karşısında rezil oldu.
The man who killed the $10,000 GPU myth. He did it alone, from Bulgaria, with one C file. 🤯
Meet Georgi Gerganov.
>Bulgarian developer. Nobody had heard of him.
>In March 2023, Meta’s LLaMA model leaked online
>Within days he wrote a single C file
>Called it llama.cpp
>It ran a full AI model on a MacBook. No GPU. No cloud.
>The entire AI industry said you needed $10,000 GPUs to run LLMs 🔥
>He proved you didn’t. On a laptop. Alone.
>Also built whisper.cpp ~ same thing for voice AI
> His code is the foundation of Ollama, LM Studio, and GPT4All
>107,000+ GitHub stars. Fastest open-source AI project to hit 100K ever. 🚀
>In 2026 Hugging Face hired his entire team
>Still ships code. Still open source. Still free.
Every time you run AI locally, you’re running his work.
Absolute Legend 🐐
Jerry Cain from Stanford University explains pointers and structs in C, showing a clever way to access struct fields. This series is one of the best resources online for C programming.
Consecuencias irreparables. Los pacientes que padecen esclerosis múltiple piden al IEES que les entregue las medicinas que necesitan para soportar esta enfermedad catastrófica. Su falta les causa graves daños a su condición.
‼️#URGENTE
Pacientes con esclerosis múltiple denuncian la falta de medicamentos en el IESS y alertan sobre el grave deterioro de su salud. Gustavo, de 32 años, asegura que no recibe Ocrelizumab en el Hospital Teodoro Maldonado Carbo, pese a que este tratamiento es fundamental para frenar el avance de esta enfermedad catastrófica e incurable. “Quiero trabajar, tener una familia y una vida normal”, expresó el paciente, quien ya necesita bastón para movilizarse.
▶️ @lahistoriaec
‼️#URGENTE
Pedro Canales denuncia que su marcapasos, implantado hace 8 años, está por agotarse y podría dejarlo con pocos meses de vida “Los doctores me dijeron que tengo para 6 meses de carga… y todavía no me dan ninguna solución”.
▶️@EcEnDirecto