t📊 𝗤𝘂𝗲́ 𝗵𝗮𝗰𝗲𝗿 𝗰𝘂𝗮𝗻𝗱𝗼 𝘁𝘂𝘀 𝗱𝗮𝘁𝗼𝘀 "𝗱𝗲𝘀𝗮𝗽𝗮𝗿𝗲𝗰𝗲𝗻": 𝗚𝘂𝗶́𝗮 𝗽𝗿𝗮́𝗰𝘁𝗶𝗰𝗮 𝗱𝗲 𝘃𝗮𝗹𝗼𝗿𝗲𝘀 𝗮𝘂𝘀𝗲𝗻𝘁𝗲𝘀 (𝗡𝗔)
Uno de los problemas más habituales, incómodos y críticos en el día a día de cualquier analista.
https://t.co/g5e5eYUMNt
🐍 Curso de Python para Ciencia de Datos GRATIS de la mano de freeCodeCamp 👇
→ EDA
→ A/B Testing
→ BI
→ Proyectos
✅ +5.5 horas de video
✅ Teoría + práctica
🔗 https://t.co/bpRLtxSlI8
¡Accede a los mejores modelos de IA via API gratis!
→ DeepSeek
→ Qwen
→ Kimi
→ GPT-OSS
→ Llama, y más.
🚀 +10K peticiones diarias y 1M de tokens
🔗 https://t.co/Zwu4a7aBox
🧠 ¡Memoria persistente para tu IA entre sesiones!
→ Claude Code, Codex, Cursor, Gemini CLI y más.
Esta herramienta gratuita de código abierto acumula 17.8k stars en GitHub.
Tu agente de IA parece Dory, y olvida todo cuando termina la sesión. Deja de gastar tokens explicándole lo mismo una y otra vez.
Se ejecuta en segundo plano, registra lo que tu agente hace en cada sesión, lo comprime y lo inyecta cuando la siguiente sesión comienza.
🔗 https://t.co/U0ucbPHMO7
Random Forest can do much more than just prediction. It is also a powerful tool for feature selection.
A Random Forest builds many decision trees using different random samples of the data and predictors. During this process, the algorithm evaluates how much each variable improves the model’s predictions.
From this, we can compute variable importance scores. These scores show which predictors contribute most to the model. Variables with higher importance values are more relevant, while variables with very low importance may add little useful information.
This makes Random Forest a practical method for reducing model complexity and focusing on the predictors that truly matter.
The figure below illustrates several aspects of this process, including variable importance rankings, an example decision tree used inside a random forest, and a comparison of how consistently different methods select variables across repeated simulations.
Would you like to learn more about topics like this? Join my newsletter where I regularly share tips about statistical methods, data science, AI, and programming in R and Python.
Learn more by visiting this link: https://t.co/ktUcWo9XpO
#RStats #statisticians #datastructure #R #database #coding
¡Crea tu propio modelo de IA! Este repositorio contiene el código para desarrollar, pre-entrenar y ajustar un LLM como GPT desde cero:
https://t.co/wZxr7eheaH
📊 La estadística es una parte fundamental en la Ciencia de Datos.
Puede parecer aburrido, pero cuando entiendes las bases, todo cobra sentido.
Hoy te muestro 6 conceptos importantes que tienes que conocer 👇🏻
📈 ¿Quieres dedicarte a la Ciencia de Datos y te han dicho que la Estadística es muy importante?
Así es, no basta con saber Python.
La estadística es el corazón para entender los datos, no solo para procesarlos.
Aquí tienes los 6️⃣ conceptos estadísticos fundamentales que necesitas conocer para analizar datos con criterio:
📊 1. No resumas, visualiza (El Histograma)
El primer error es intentar resumir un millón de datos con un solo número. Eso es imposible. Antes de lanzar modelos complejos, necesitas entender la forma de tus datos.
Un histograma te permite ver cómo se distribuyen los valores (por ejemplo, cuántos amigos tienen los usuarios de tu red social) y detectar si hay algo extraño a simple vista.
🎯 ¿Dónde está el centro? (Media vs. Mediana)
Todos conocemos el promedio (la media), pero tiene un punto débil: es hipersensible a los outliers (valores atípicos).
- El problema: Si en una sala entra una persona con 200 amigos cuando el resto tiene 5, el promedio se dispara y engaña. O como dice la leyenda: si Michael Jordan entra en una clase de geografía, la media de salarios futuros se dispara, pero eso no representa la realidad de la clase.
- La solución: La Mediana. Es el valor central y no le importan los extremos. Si tus datos tienen mucho ruido, fíate más de la mediana.
Hacer ciencia de datos es saber cuándo usar cada una.
💦 La Dispersión (Varianza y Desviación Estándar)
Saber el centro no es suficiente; necesitas saber qué tan dispersos están los datos.
- El Rango (Máximo - Mínimo) es demasiado básico y frágil.
- La Varianza mide cómo se alejan los datos de la media, pero sus unidades son "al cuadrado", lo que la hace difícil de interpretar mentalmente.
- La Desviación Estándar es la reina. Al ser la raíz cuadrada de la varianza, vuelve a tener las mismas unidades que tus datos originales, haciéndola mucho más intuitiva para explicar qué es "normal" y qué es "raro".
🔗 Correlación no es lo que crees
La correlación nos dice cómo se relacionan dos variables (si "X" sube, ¿"Z" sube o baja?).
Pero hay una trampa: una correlación de cero no significa que no haya relación, solo significa que no hay relación lineal. Tus variables podrían tener una relación compleja que la correlación simple no detecta.
🤯 La Paradoja de Simpson
Este es el concepto que separa a los novatos de los expertos.
Las correlaciones pueden ser totalmente engañosas si ignoras las variables de confusión. Intento que lo entiendas:
Imaginate dos campañas de marketing (A y B), la Campaña B convierte mejor que la A (30% vs 20%) Pero si filtras por dispositivo, la Campaña A gana tanto en Móvil como en PC.
¿La razón? La variable oculta (tipo de dispositivo) distorsionaba el promedio global. Los datos agregados mienten; analiza siempre los subgrupos.
⚠️ La Regla de Oro: Correlación ≠ Causalidad
Que dos cosas se muevan juntas no significa que una cause la otra.
Tienes una red social. ¿Los usuarios pasan más tiempo en tu web porque tienen más amigos? ¿O tienen más amigos porque pasan más tiempo en la web? ¿O es que los usuarios más activos simplemente son más propensos a ambas cosas?.
Nunca asumas la causa de algo sin pruebas.
👉 La estadística nos ayuda a sintetizar y comunicar las características relevantes de nuestros datos. Sin estos conceptos, solo estás ejecutando funciones de librerías sin entender el porqué.
📊 En un proyecto de Ciencia de Datos es muy importante tener una buena fuente de datos.
Con este repositorio de APIs públicas puedes tener una gran variedad, además de otros endpoints para diferentes usos.
Guárdatelo y empieza a experimentar 👇🏻
📢 Este repositorio tiene la colección más grande de APIs públicas de todo internet.
+1500 endpoints → una joya que todo dev tiene que tener en favoritos.
ML, crypto, clima, finanzas, OCR, salud, datos, música, y un largo etc.
Guárdatelo para tu siguiente proyecto 👇
If you regularly create plots in R, the tidyplots package is definitely worth exploring.
tidyplots builds on ggplot2 and follows a tidyverse-style syntax. This means that plots are created through clear, step-by-step function calls that can be combined in a readable and consistent way. In many cases, these steps are connected using pipe operators, allowing the output of one function to be passed directly to the next.
Advantages of tidyplots:
🔹 Clear and readable syntax for building plots step by step
🔹 Seamless integration with the tidyverse workflow
🔹 Convenient helper functions for common visualization tasks
🔹 Less code required compared to complex ggplot2 calls
🔹 Makes it easier to create clean and publication-ready graphics
If you are interested in more topics like this, you can join my newsletter where I regularly share tips on statistical methods, data science, AI, and programming with R and Python.
Further details: https://t.co/ktUcWo9XpO
#ggplot2 #tidyverse #Rpackage #database #datastructure #R4DS #VisualAnalytics #DataViz #programmer #RStats #statisticsclass
El mercado está saturado de Juniors y para que se fijen en tu perfil tienes que destacar.
🤔 ¿Has montado ya tu primer proyecto personal?
Haciendo dos tonterías te pones por delante del 90% de CVs.
Te cuento los primeros pasos 👇🏻
📊 Muchos me preguntan si pueden conseguir trabajo en Data o IA sin tener experiencia laboral.
Yo les digo que sí. ¿Pero es fácil? En absoluto.
Coleccionar cursos no te va a servir de nada una vez que ya tengas los conocimientos.
La diferencia está en como aplicas esas habilidades adquiridas.
👉 El mejor consejo → Toma acción y construye algo.
Un proyecto personal, sencillo, lo que sea.. pero que haya algo real que puedas enseñar.
➀ Entra en Kaggle o en Google Dataset Search
➁ Busca un dataset
➂ Analízalo (EDA)
➃ Trabájalo, limpialo y transformalo
➄ Crea un modelo
➅ Haz un reporte
➆ Súbelo a tu Git o portfolio
Tienes muchas opciones para poder crearte un portfolio y empezar a tener entrevistas.
Aunque no seas Junior, nunca está de más tener un buen proyecto que enseñar al mundo.
🧐 Recuerda → Proyectos >>>> Cursos
⚙️ ¿Conoces el funcionamiento básico de un ciclo MLOps en Ciencia de Datos?
Orquestar y automatizar tus pipelines es un paso obligatorio si trabajas en el mundo real.
Te lo cuento 👇🏻
📚¿Crees que la estadística es intimidante o aburrida?
Estos 4 libros van a cambiar completamente tu perspectiva 👇
Para pensar estadísticamente necesitas curiosidad, un poco de escepticismo saludable, y ganas de hacer preguntas inteligentes a los datos.
#stats#datascience
Nadie te enseña esto cuando aprendes Machine Learning.
Sabes entrenar modelos. Sabes hacer predicciones.
Pero cuando alguien te pregunta cómo funciona tu pipeline en producción, te quedas callado.
Un proyecto de ML real no es un notebook bonito.
Es una cadena de procesos que tiene que funcionar sola. Sin que nadie la toque.
Esa cadena tiene 3 partes:
🔄 Pipeline de Transformación
Antes de entrenar cualquier modelo, los datos tienen que estar preparados.
Esto puede ser tan simple como separar train y validación, convertir formatos o hacer joins entre fuentes distintas.
Pero hay un concepto que marca la diferencia entre un proyecto amateur y uno profesional: el Feature Store.
Un Feature Store no almacena datasets completos. Almacena features independientes que pueden compartir varios modelos a la vez, se actualiza en tiempo real y devuelve el dato en formato clave-valor.
Ejemplo real: cuando Uber estima el tiempo de llegada de un trayecto, no le basta con los datos de la petición. Necesita consultar en tiempo real cuántos vehículos hay disponibles en esa zona. Eso es un Feature Store.
🧠 Pipeline de Entrenamiento
Este pipeline tiene varios pasos encadenados:
→ Transformación: prepara los datos específicos para ese modelo
→ Entrenamiento: recibe el dataset y genera el artefacto del modelo
→ Validación: mide la bondad del modelo sobre datos que no ha visto
→ Registro: si las métricas no son suficientemente buenas, el modelo no se guarda
Cada modelo y dataset se versiona con un ID único basado en el timestamp de ejecución y la versión del código. Esto permite comparar resultados entre versiones y hacer releases controlados.
⚡ Pipeline de Predicción
Hay dos tipos y los dos tienen que coexistir en cualquier proyecto serio:
→ Streaming: levanta un servicio de predicción en tiempo real. Útil cuando necesitas una respuesta inmediata bajo demanda.
→ Batch: genera predicciones masivas de forma automática para un archivo de datos completo.
El truco para no duplicar código: el pipeline batch levanta el servicio de streaming, lanza predicciones en paralelo para cada registro, las escribe en un archivo y mata el servicio al terminar.
Y si necesitas saber por qué el modelo tomó una decisión concreta, existe un tercer paso:
Explicabilidad → Devuelve la predicción junto con los factores que más influyeron en ella.
🎯 En resumen: Transformar, Entrenar y Predecir → Repetir.
Un proyecto de ML tiene que funcionar sin ti y estar lo más automatizado posible siguiendo los principios MLOps.
👉 Si te ha servido esta mini-clase → Guárdatelo, dale like y RT para más contenido sobre Ciencia de Datos e IA.
Google ha lanzado su skill Modern Web Guidance.
Evita que tu IA genere webs con patrones antiguos y APIs desactualizadas.
✓ Guías revisadas por expertos
✓ Para Claude Code, Cursor, Antigravity y más
Instalación → https://t.co/UB9Ik3nfyQ