Hola! Bienvenida a este libro 🌸
Esto no es un artículo largo: es un libro de diecisiete capítulos que se leen en orden, con más de cien ejercicios resueltos y con todo el código comprobado.
Y cuando digo comprobado lo digo en serio. Cada bloque de este libro se ejecuta de verdad y su resultado se compara con lo que está publicado. Si algún día pandas cambia y una salida deja de coincidir, aquí se entera antes que tú 💜
Para quién es
Para ti si:
- 🌱 Nunca programaste y quieres empezar por algo que sirva de verdad.
- 📊 Vives en Excel y ya te quedó chico.
- 🔁 Haces el mismo reporte cada mes a mano y sabes que eso se puede automatizar.
- 💼 Estás cambiando de carrera hacia datos y necesitas una base seria.
No hace falta saber matemáticas. No hace falta instalar nada para empezar. Y sí, se puede desde cero: el capítulo 1 empieza literalmente por abrir el navegador.
Si quieres el contexto antes de programar
No hace falta para seguir el libro, pero si te gusta entender el mapa antes de caminarlo, estos posts te lo dan en cinco minutos cada uno:
- 💻 Cómo aprender programación desde cero, si es tu primer lenguaje.
- ☁️ Qué es Google Colab, que es donde vas a escribir el capítulo 1.
- 🐍 La sintaxis de Python, un repaso rapidísimo de lo que ves en los capítulos 2 a 5.
- 📊 NumPy y matplotlib, el resumen corto de los capítulos 10 y 12.
- 🧮 Qué es un algoritmo, por si la palabra te suena grande.
- 🗄️ Qué es una base de datos, que es de dónde saldrán tus datos en una empresa.
Cómo se lee
Los capítulos van en orden y cada uno supone el anterior. Si te tienta saltarte los primeros porque "eso ya lo sé", mira sus ejercicios: si los sacas de memoria, avanza tranquila 🙂
Y una cosa que te pido: escribe el código, no lo copies. Se aprende con los dedos, no con los ojos. El botón de copiar está para las salidas largas, no para el código.
Sobre qué datos corre todo
Sobre un solo archivo: 3.037 ventas de una distribuidora peruana. Y no es un archivo limpio a propósito, porque un archivo limpio no enseña nada de lo que después te va a pasar.
Este trae fechas en dos formatos, la ciudad escrita de cuatro maneras distintas, montos con coma decimal, filas duplicadas y tres tipos distintos de dato faltante. O sea, la vida real 😅
Los archivos del libro
Son dos archivos: el de ventas, que se usa casi todo el libro, y el de comentarios de clientes, que es el del capítulo de expresiones regulares. El cuaderno de Colab corre de arriba abajo sin instalar nada.
Y hay algo más, que es lo que de verdad se usa para practicar: cada capítulo tiene su propio cuaderno, con su código y sus ejercicios con una celda vacía debajo para que los hagas tú. El botón está al final de cada capítulo, y al lado va el de soluciones para cuando ya te hayas peleado un rato 📓
Antes de empezar, una prueba rápida
Para que veas cómo funcionan los quiz del libro. No pasa nada si fallas, para eso están 🌟
Comprueba que lo tienes
Tienes un DataFrame de 300.000 filas y quieres una columna nueva que sea monto * 1.18. ¿Cuál de estas es la correcta?
df["con_igv"] = df["monto"] * 1.18- Un
forque recorra las filas coniterrows() df.apply(lambda f: f["monto"] * 1.18, axis=1)- Convertir a lista, multiplicar y volver a meter
Y una trampa, que también las hay en cada capítulo
La trampa
Este cuaderno corría perfecto en la máquina de quien lo escribió y daba un número distinto cada vez que lo corría otra persona.
df = pd.read_csv('C:/Users/gera/Escritorio/ventas.csv') muestra = df.sample(500) X_train, X_test = train_test_split(muestra, test_size=0.2) print('Precision:', evaluar(X_train, X_test))
Qué está mal
Tres cosas, y las tres se arreglan con una palabra. La ruta absoluta no existe en la computadora de nadie más. El sample y el train_test_split van sin random_state, así que cada corrida toma otras filas y devuelve otro número: no puedes saber si mejoraste el modelo o si tuviste suerte esta vez.
Qué vas a poder hacer al terminar
- 📥 Cargar cualquier archivo que te manden, aunque venga sucio.
- 🧹 Limpiarlo dejando registro de lo que cambiaste.
- ❓ Decidir qué hacer con los huecos, que casi nunca es rellenarlos.
- 📊 Agrupar, comparar y sacar la tabla que te piden.
- 📈 Graficarlo para que se entienda sin que lo expliques.
- 💬 Terminar en una conclusión con su número y con sus límites bien dichos.
Y si quieres hacerlo acompañada
Este libro es gratis y lo va a seguir siendo. Si prefieres trabajarlo conmigo y sobre tus propios datos, eso es lo que hacemos en el Full Day IA 💜
Y si lo tuyo es la empresa y no el aprendizaje individual, ahí está la consultoría.
Preguntas frecuentes sobre este libro
¿Necesito saber programar para empezar?
No. El capítulo 1 empieza literalmente por abrir el navegador y escribir tu primera línea, sin instalar nada. Si nunca programaste, este libro está escrito pensando en ti.
¿Cuánto tiempo toma terminarlo?
Cada capítulo se lee en una sentada y se hace en una tarde con sus ejercicios. A un capítulo por semana son unos tres meses. A dos por semana, mes y medio. Lo que alarga el plazo casi nunca es la cantidad de material: es no tener datos propios con los que practicar.
¿Hace falta instalar Python?
No para aprender. Todo el libro corre en Google Colab, que es Python en el navegador y es gratis. El capítulo 1 explica cuándo sí conviene instalarlo en tu máquina y cómo hacerlo sin el error de la casilla del PATH.
¿Sirve si ya sé algo de Python?
Sí, y te recomiendo mirar los ejercicios de cada capítulo antes de leerlo: si los sacas de memoria, avanza. Los capítulos que más suelen aportar a quien ya programa son el 6 (errores), el 10 (vectorización) y el 11 (pandas de verdad, con el archivo sucio).
¿Python o R para análisis de datos?
Python si vas a trabajar en empresa, porque es lo que se pide y porque conecta con todo lo demás: APIs, producción, machine learning. R sigue siendo excelente para estadística académica y visualización. Si dudas y buscas empleo, Python.
¿El código de verdad funciona?
Sí, y no es una promesa: cada bloque publicado se ejecuta automáticamente y su salida se compara con lo que está escrito. Si una versión de pandas cambia y una salida deja de coincidir, el sistema avisa antes de que lo notes tú.
Después de este libro
El orden que yo recomiendo:
- 🗃️ SQL desde cero, porque en una empresa los datos no llegan en CSV: están en una base.
- 📐 Estadística desde cero, para saber si una diferencia es real o es ruido.
- 🤖 Machine learning desde cero, cuando la pregunta pase de qué pasó a qué va a pasar.
Nos vemos en el capítulo 1. Que tengas un hermoso día! 🌟
Los 17 capítulos
Se leen en orden. Cada uno supone el anterior.
- 1 Para qué sirve Python Qué es, qué resuelve de verdad, qué no hace bien, y cuándo te conviene más quedarte en Excel.
- 2 Instalar Python y correr lo primero Las tres formas de ejecutar Python, cuál te conviene hoy, y cómo leer el primer error sin cerrar la laptop.
- 3 Variables, números y texto Los cuatro tipos que vas a usar siempre, el error de sumar texto con número, y por qué 0,1 más 0,2 no da 0,3.
- 4 Listas, tuplas y diccionarios Guardar muchas cosas juntas, las rebanadas, y la copia que no se copió, que es el error más traicionero del principio.
- 5 Condicionales y bucles El momento en que Python deja de ser una calculadora, y la sangría que no es estética sino sintaxis.
- 6 Funciones Empaquetar trabajo con nombre, devolver resultados, y la trampa del argumento por defecto que muerde en producción.
- 7 Errores y depuración Los errores que de verdad salen con datos, cómo atraparlos sin taparlos, y cómo encontrar el problema sin volverte loca.
- 8 Módulos, paquetes y entornos virtuales Salir del cuaderno, importar sin romper nada, y la respuesta a "en mi máquina funcionaba".
- 9 Objetos, lo justo Por qué df.head() lleva un punto, qué es un método, y cuándo te conviene crear una clase (spoiler: pocas veces).
- 10 Leer y escribir archivos Abrir lo que te mandan sin romperlo, y por qué a veces ves "á" donde debería haber una á.
- 11 NumPy y la vectorización Por qué el mismo cálculo puede tardar decenas de veces más escrito de una forma que de otra, y el arreglo que está debajo de pandas.
- 12 pandas El capítulo por el que la mayoría aprende Python, sobre un archivo sucio de verdad y con el aviso que sale en rojo.
- 13 Sacar datos de un texto escrito por personas Expresiones regulares sobre 2.440 comentarios de clientes, con sus tildes que faltan y sus emojis.
- 14 Cuando los datos no vienen en un archivo Una base de datos y una API desde Python, con la API montada aquí mismo para que corra sin internet.
- 15 Gráficos que se entienden matplotlib sin adornos, y la regla que vale más que todas las opciones de color juntas.
- 16 De datos sucios a una conclusión Todo el libro junto, de punta a punta, y terminando en algo que se puede llevar a una reunión.
- 17 Referencias y de dónde salió cada cosa La documentación oficial, las fuentes de lo que aquí se afirma y qué leer cuando termines este libro.
Los 171 ejercicios de este libro están también en 16 cuadernos que se abren en Colab sin instalar nada. Escribes tu respuesta y el cuaderno te dice si te salió 💛
Y 10 ejercicios más sobre datos públicos: Los 1.893 distritos del Perú →
El libro entero en PDF
Con el índice, los 17 capítulos y las soluciones de todos los ejercicios al final de cada uno. Te lo mando a tu correo 💛
4,0 MB · Se lee igual y gratis acá, siempre.
¿Quieres llevarlo más lejos?
Esta guía te deja operando. El curso te deja diseñando, midiendo y gobernando sistemas de IA que trabajan solos.
Ver los cursos