Gratis Guía escrita 17 capítulos 283 min de lectura

Python desde cero

Del primer print a pandas, con el temario completo del curso y la parte donde de verdad abandona la gente.

Gera Flores, Miss Yera Gera Flores · Miss Yera
Compartir

Python para análisis de datos se aprende en tres tramos: el lenguaje base (variables, control de flujo y funciones), el manejo de datos externos (archivos y APIs) y por último las librerías de análisis (NumPy, pandas y matplotlib). La mayoría de la gente abandona en la instalación, no en la programación, así que conviene empezar en Google Colab y no instalar nada hasta que programar te resulte natural.

Hola! Bienvenida a este libro 🌸

Esto no es un artículo largo: es un libro de diecisiete capítulos que se leen en orden, con más de cien ejercicios resueltos y con todo el código comprobado.

Y cuando digo comprobado lo digo en serio. Cada bloque de este libro se ejecuta de verdad y su resultado se compara con lo que está publicado. Si algún día pandas cambia y una salida deja de coincidir, aquí se entera antes que tú 💜

Para quién es

Para ti si:

  • 🌱 Nunca programaste y quieres empezar por algo que sirva de verdad.
  • 📊 Vives en Excel y ya te quedó chico.
  • 🔁 Haces el mismo reporte cada mes a mano y sabes que eso se puede automatizar.
  • 💼 Estás cambiando de carrera hacia datos y necesitas una base seria.

No hace falta saber matemáticas. No hace falta instalar nada para empezar. Y sí, se puede desde cero: el capítulo 1 empieza literalmente por abrir el navegador.

Si quieres el contexto antes de programar

No hace falta para seguir el libro, pero si te gusta entender el mapa antes de caminarlo, estos posts te lo dan en cinco minutos cada uno:

Cómo se lee

Los capítulos van en orden y cada uno supone el anterior. Si te tienta saltarte los primeros porque "eso ya lo sé", mira sus ejercicios: si los sacas de memoria, avanza tranquila 🙂

Y una cosa que te pido: escribe el código, no lo copies. Se aprende con los dedos, no con los ojos. El botón de copiar está para las salidas largas, no para el código.

Sobre qué datos corre todo

Sobre un solo archivo: 3.037 ventas de una distribuidora peruana. Y no es un archivo limpio a propósito, porque un archivo limpio no enseña nada de lo que después te va a pasar.

Este trae fechas en dos formatos, la ciudad escrita de cuatro maneras distintas, montos con coma decimal, filas duplicadas y tres tipos distintos de dato faltante. O sea, la vida real 😅

Los archivos del libro

Son dos archivos: el de ventas, que se usa casi todo el libro, y el de comentarios de clientes, que es el del capítulo de expresiones regulares. El cuaderno de Colab corre de arriba abajo sin instalar nada.

Y hay algo más, que es lo que de verdad se usa para practicar: cada capítulo tiene su propio cuaderno, con su código y sus ejercicios con una celda vacía debajo para que los hagas tú. El botón está al final de cada capítulo, y al lado va el de soluciones para cuando ya te hayas peleado un rato 📓

Antes de empezar, una prueba rápida

Para que veas cómo funcionan los quiz del libro. No pasa nada si fallas, para eso están 🌟

Comprueba que lo tienes

Tienes un DataFrame de 300.000 filas y quieres una columna nueva que sea monto * 1.18. ¿Cuál de estas es la correcta?

  • df["con_igv"] = df["monto"] * 1.18
  • Un for que recorra las filas con iterrows()
  • df.apply(lambda f: f["monto"] * 1.18, axis=1)
  • Convertir a lista, multiplicar y volver a meter

Y una trampa, que también las hay en cada capítulo

La trampa

Este cuaderno corría perfecto en la máquina de quien lo escribió y daba un número distinto cada vez que lo corría otra persona.

df = pd.read_csv('C:/Users/gera/Escritorio/ventas.csv')
muestra = df.sample(500)
X_train, X_test = train_test_split(muestra, test_size=0.2)
print('Precision:', evaluar(X_train, X_test))
Qué está mal

Tres cosas, y las tres se arreglan con una palabra. La ruta absoluta no existe en la computadora de nadie más. El sample y el train_test_split van sin random_state, así que cada corrida toma otras filas y devuelve otro número: no puedes saber si mejoraste el modelo o si tuviste suerte esta vez.

Qué vas a poder hacer al terminar

  • 📥 Cargar cualquier archivo que te manden, aunque venga sucio.
  • 🧹 Limpiarlo dejando registro de lo que cambiaste.
  • ❓ Decidir qué hacer con los huecos, que casi nunca es rellenarlos.
  • 📊 Agrupar, comparar y sacar la tabla que te piden.
  • 📈 Graficarlo para que se entienda sin que lo expliques.
  • 💬 Terminar en una conclusión con su número y con sus límites bien dichos.

Y si quieres hacerlo acompañada

Este libro es gratis y lo va a seguir siendo. Si prefieres trabajarlo conmigo y sobre tus propios datos, eso es lo que hacemos en el Full Day IA 💜

Y si lo tuyo es la empresa y no el aprendizaje individual, ahí está la consultoría.

Preguntas frecuentes sobre este libro

¿Necesito saber programar para empezar?

No. El capítulo 1 empieza literalmente por abrir el navegador y escribir tu primera línea, sin instalar nada. Si nunca programaste, este libro está escrito pensando en ti.

¿Cuánto tiempo toma terminarlo?

Cada capítulo se lee en una sentada y se hace en una tarde con sus ejercicios. A un capítulo por semana son unos tres meses. A dos por semana, mes y medio. Lo que alarga el plazo casi nunca es la cantidad de material: es no tener datos propios con los que practicar.

¿Hace falta instalar Python?

No para aprender. Todo el libro corre en Google Colab, que es Python en el navegador y es gratis. El capítulo 1 explica cuándo sí conviene instalarlo en tu máquina y cómo hacerlo sin el error de la casilla del PATH.

¿Sirve si ya sé algo de Python?

Sí, y te recomiendo mirar los ejercicios de cada capítulo antes de leerlo: si los sacas de memoria, avanza. Los capítulos que más suelen aportar a quien ya programa son el 6 (errores), el 10 (vectorización) y el 11 (pandas de verdad, con el archivo sucio).

¿Python o R para análisis de datos?

Python si vas a trabajar en empresa, porque es lo que se pide y porque conecta con todo lo demás: APIs, producción, machine learning. R sigue siendo excelente para estadística académica y visualización. Si dudas y buscas empleo, Python.

¿El código de verdad funciona?

Sí, y no es una promesa: cada bloque publicado se ejecuta automáticamente y su salida se compara con lo que está escrito. Si una versión de pandas cambia y una salida deja de coincidir, el sistema avisa antes de que lo notes tú.

Después de este libro

El orden que yo recomiendo:

Nos vemos en el capítulo 1. Que tengas un hermoso día! 🌟

Los 17 capítulos

Se leen en orden. Cada uno supone el anterior.

  1. 1 Para qué sirve Python Qué es, qué resuelve de verdad, qué no hace bien, y cuándo te conviene más quedarte en Excel.
  2. 2 Instalar Python y correr lo primero Las tres formas de ejecutar Python, cuál te conviene hoy, y cómo leer el primer error sin cerrar la laptop.
  3. 3 Variables, números y texto Los cuatro tipos que vas a usar siempre, el error de sumar texto con número, y por qué 0,1 más 0,2 no da 0,3.
  4. 4 Listas, tuplas y diccionarios Guardar muchas cosas juntas, las rebanadas, y la copia que no se copió, que es el error más traicionero del principio.
  5. 5 Condicionales y bucles El momento en que Python deja de ser una calculadora, y la sangría que no es estética sino sintaxis.
  6. 6 Funciones Empaquetar trabajo con nombre, devolver resultados, y la trampa del argumento por defecto que muerde en producción.
  7. 7 Errores y depuración Los errores que de verdad salen con datos, cómo atraparlos sin taparlos, y cómo encontrar el problema sin volverte loca.
  8. 8 Módulos, paquetes y entornos virtuales Salir del cuaderno, importar sin romper nada, y la respuesta a "en mi máquina funcionaba".
  9. 9 Objetos, lo justo Por qué df.head() lleva un punto, qué es un método, y cuándo te conviene crear una clase (spoiler: pocas veces).
  10. 10 Leer y escribir archivos Abrir lo que te mandan sin romperlo, y por qué a veces ves "á" donde debería haber una á.
  11. 11 NumPy y la vectorización Por qué el mismo cálculo puede tardar decenas de veces más escrito de una forma que de otra, y el arreglo que está debajo de pandas.
  12. 12 pandas El capítulo por el que la mayoría aprende Python, sobre un archivo sucio de verdad y con el aviso que sale en rojo.
  13. 13 Sacar datos de un texto escrito por personas Expresiones regulares sobre 2.440 comentarios de clientes, con sus tildes que faltan y sus emojis.
  14. 14 Cuando los datos no vienen en un archivo Una base de datos y una API desde Python, con la API montada aquí mismo para que corra sin internet.
  15. 15 Gráficos que se entienden matplotlib sin adornos, y la regla que vale más que todas las opciones de color juntas.
  16. 16 De datos sucios a una conclusión Todo el libro junto, de punta a punta, y terminando en algo que se puede llevar a una reunión.
  17. 17 Referencias y de dónde salió cada cosa La documentación oficial, las fuentes de lo que aquí se afirma y qué leer cuando termines este libro.

Los 171 ejercicios de este libro están también en 16 cuadernos que se abren en Colab sin instalar nada. Escribes tu respuesta y el cuaderno te dice si te salió 💛

Y 10 ejercicios más sobre datos públicos: Los 1.893 distritos del Perú →

El libro entero en PDF

Con el índice, los 17 capítulos y las soluciones de todos los ejercicios al final de cada uno. Te lo mando a tu correo 💛

4,0 MB · Se lee igual y gratis acá, siempre.

¿Quieres llevarlo más lejos?

Esta guía te deja operando. El curso te deja diseñando, midiendo y gobernando sistemas de IA que trabajan solos.

Ver los cursos
¿Tienes alguna duda o consulta?