Si se han preguntado qué se requiere para entrenar un LLM, en el libro de Gen IA de databricks explican cómo lo hicieron ellos:
12T tokens de datos
3072 GPUs H100
Conectadas por 3.2Tbps
Y duraron tres meses entrenando.
Esto sin contar el tiempo de adquisición y preparación de datos...
Después de un buen rato entrenando mi propio GPT va el modelo y me suelta esto:
"llamóme padre, y yo llaméle hijo;
quedó con esto la verdad en punto,
que aquí puede llamarse punto fijo."
Sublime.