Training with more data = better LLMs, right? 🚨
False! Scaling language models by adding more pre-training data can decrease your performance after post-training!
Introducing "catastrophic overtraining." 🥁🧵+arXiv 👇
1/9
Estoy tan emocionada por ver esta película.
Ahora sé quién canta la canción del Panadero con el Pan!!!!
Al salir del cine se me cayeron cosas 3 veces y además me caí en la calle.
https://t.co/rLz1tQOeE3