Introducing 💫 Gumbel Straight Flow 💫: Distilling Autoregressive Models into One-step Flow Maps 🚀
Can autoregressive (language) models be used as teachers for flow map parallel samplers?
The holy grail of RSI is the mathematically optimal self-referential Gödel Machine (2003) [GM3-9] (Sec. 5 of the RSI report above). It inspired lots of recent work, e.g., the Darwin-Gödel Machine (2025) [GMD25], the Huxley-Gödel Machine (2026) [GMH26], the Red Queen Gödel Machine (2026) [GMR26]... See also our 2026 survey [RSI26] and its tweet https://t.co/VlJxnzlizV
Recently learned that Schmidhuber’s Formal Theory of Fun and Creativity, covering compression progress and intrinsic motivation and their relationship to beauty, curiosity, art, science, music, and jokes, was published in a Japanese scientific journal in 2009.
https://t.co/iQcJf9r3K2
It is wild that this framework: compression progress as the basis for beauty, curiosity, art, science, and even jokes, was laid out in full formal detail in a Japanese journal 15 years ago.
IQ maxxing is very simple when you have the right habits:
1) think through what you need to do that day, so you act intentionally
2) do one cognitively hard thing daily: coding, math, writing, building, or whatever is tied to your real goals
3) build things with feedback loops and let reality correct you
4) write every day to force yourself to articulate thoughts precisely
5) read smart minds, then reflect and write instead of just consuming
6) make predictions + review them. it trains calibration instead of hindsight
7) protect your attention, exercise, and sleep properly
it's mostly about designing your life around your brain getting constant reps + feedback.
you get smarter by thinking, being wrong, and iterating.
Get addicted to neuroplasticity, subconscious reprogramming, delusional optimism, game theory, quantum physics, cognitive biases, systems thinking, epigenetics, and first-principles thinking. I promise it will change your life.
I put together a handbook on how speculative decoding actually works, starting with why autoregressive generation is serial and what changes when a cheaper proposer drafts several future tokens for the target model to verify together.
It works through greedy verification, exact speculative sampling, the min(1, p/q) acceptance rule, residual correction, acceptance rate, expected tokens per verification, draft-length and wall-time trade-offs, KV-cache commit and rollback, tokenizer compatibility, self-speculation, Medusa, SpecInfer, EAGLE, MTP, prompt lookup, dynamic speculation, and current serving implementations. Worked examples throughout, with citations back to the original papers and current documentation.
One thing I wanted to make especially clear is that acceptance rate is not speedup.
In one simple example from the handbook, α = 0.8 and γ = 4 gives 3.3616 expected tokens per target verification. But when draft cost rises from 0.05 to 0.20 of a target step, the same simple model drops from about 2.80× predicted speedup to 1.87×.
Made it to be the explanation I wish I’d had when I first tried to understand how speculative decoding can reduce expensive serial target steps while, under strict verification, preserving the target distribution.
Sharing the handbook here:
Being a "trans woman" means that the person claiming that status was born male. So unless someone is going to claim that biological sex changes during transition, which is absurd, the discussion about what characteristics are relevant to being a woman is silly. TiMs are, by definition, males.
Il y a quelques années, j'ai vu une vidéo où Elon Musk expliquait que la majorité des PhD ne servaient à rien. Sur le moment, j'ai trouvé ça excessif.
Puis j'ai commencé à bosser dans l'IA. Et aujourd'hui, je lis des papiers de recherche toutes les semaines. Et bien souvent, je referme le PDF en me disant : mais putain, à quoi ça sert ? Des mois de travail, souvent payés par l'argent public, pour produire des trucs qui ne créent absolument aucune valeur. Aucun produit. Aucune avancée. Aucune idée nouvelle. De la branlette intellectuelle.
Et j'ai fini par comprendre. Quand un système est gangrené par l'idéologie, il cesse de récompenser ce qui marche. Il récompense ce qui se conforme. On ne cherche plus la vérité, on cherche la publication. On ne cherche plus à construire, on cherche à être cité par ses pairs. Le réel n'est plus le juge. Le comité l'est.
C'est pour ça que ce que fait Alex Karp chez Palantir est génial. Il ne se plaint pas de l'université. Il la contourne. Il prend des jeunes de 18 ans, les met sur de vrais problèmes, avec de vrais enjeux, et les juge sur une seule chose : est-ce que ça marche ? C'est la plus vieille pédagogie du monde. Et c'est la plus efficace.
Mais Palantir ne peut pas tout faire. C'est l'intégralité du modèle éducatif qu'il faut reset. De la maternelle jusqu'au doctorat.
Regardez ce qu'a fait Elon Musk avec Ad Astra, l'école qu'il a créée pour ses enfants. Pas de classes par âge. Pas de notes. Pas de cours magistraux sur des outils dont on ne comprend pas l'utilité. On part d'un problème. Si on veut comprendre un moteur, on ne commence pas par un cours sur les tournevis. On donne un moteur aux enfants, et on leur demande de le démonter. Les outils viennent naturellement, parce qu'on en a besoin.
Et surtout, Musk a une image que je trouve magnifique : il faut apprendre en arbre. D'abord le tronc, les principes fondamentaux. Puis les grosses branches. Et seulement ensuite les feuilles, les détails. Sinon les détails n'ont rien à quoi s'accrocher, et ils tombent. Notre école fait exactement l'inverse. Elle déverse des milliers de feuilles sur des enfants qui n'ont jamais vu le tronc. Puis elle s'étonne qu'ils oublient tout.
Et maintenant, l'IA change absolument tout.
En 1984, le chercheur Benjamin Bloom fait une découverte qui aurait dû révolutionner l'éducation. Un élève qui bénéficie d'un tuteur particulier progresse de deux écarts-types par rapport à un élève en classe classique. Concrètement, un élève moyen devient meilleur que 98 % de ses camarades. Le problème : on ne pouvait pas offrir un précepteur à chaque enfant. Trop cher. Réservé aux princes.
Aristote était le précepteur d'Alexandre le Grand. Pendant 2 500 ans, ce privilège a été réservé aux fils de rois.
Aujourd'hui, chaque enfant de la planète peut avoir son Aristote dans sa poche. Un tuteur infiniment patient, disponible à toute heure, qui s'adapte à son rythme, qui connaît toutes les disciplines, et qui peut lui faire remonter l'arbre du savoir du tronc jusqu'aux feuilles.
C'est la plus grande révolution éducative depuis l'imprimerie. Et la gauche va mourir dessus. Parce que tout son pouvoir reposait sur le monopole de la transmission. Quand chaque enfant peut apprendre directement, sans passer par l'idéologie de l'institution, le monopole s'effondre.
Alors voici ce que je pense qu'il faudrait faire. Que des milliardaires reprennent des universités privées. Il y en a des dizaines en difficulté chaque année. Qu'ils virent toute la bureaucratie administrative qui a proliféré pendant trente ans. Et qu'ils en fassent des écoles de droite, fondées sur le mérite, la compétence et la recherche de la vérité. Pas des écoles qui remplacent une idéologie par une autre. Des écoles qui apprennent à penser, pas quoi penser.
Le modèle existe déjà. Il a 2 500 ans.
À Athènes, on ne formait pas des spécialistes. On formait des hommes complets. Au Lycée d'Aristote, on étudiait la biologie le matin, la politique l'après-midi, la logique le soir. On marchait en débattant. On cherchait la vérité ensemble, sans peur, sans tabou. Les Grecs avaient un mot pour ça : la paideia. La formation de l'être tout entier.
C'est de là que sont sortis ceux qui ont inventé la philosophie, la démocratie, la géométrie, le théâtre, la médecine. En quelques générations, une petite cité a posé les fondations de toute la civilisation occidentale.
Voilà ce qu'on doit reconstruire. Des écoles de polymathes. Des esprits libres capables de coder et de lire Platon, de comprendre une équation et de défendre une idée, de douter de tout y compris d'eux-mêmes. Des penseurs qui travailleront avec l'IA comme copilote et qui inventeront des choses que nous ne pouvons même pas imaginer aujourd'hui.
Athènes avait des esclaves pour libérer du temps aux penseurs. Nous aurons des machines. Pour la première fois de l'histoire, une civilisation entière peut devenir Athènes.
Ce n'est pas la fin de l'école. C'est sa renaissance.