Capítulo 23 de 23 8 secciones 10 min

Compartir

Referencias y dónde seguir

Las herramientas, los números que se repiten en el libro, y lo que este libro no cubre.

Para seguir después de este libro te dejo la documentación de scipy.stats para las pruebas, la de pandas para el manejo de datos, y tres caminos según lo que necesites, que son regresión, inferencia causal y estadística bayesiana. Ninguno de los tres sale acá, y los tres me han hecho falta en trabajos de verdad.

Quince capítulos 🎉 Este último es el mapa para cuando ya no estemos mirando juntas el mismo archivo.

Y cuando cierres el libro, la pregunta que queda es una: ¿cuál va a ser la primera diferencia que midas en serio? Aunque sea la de dos meses de tu propio negocio, esa es la que enseña 💜

Las herramientas, y qué mirar de cada una

HerramientaDóndePara qué en este libro
scipy.stats docs.scipy.org Todas las pruebas: t, ji cuadrado, ANOVA, Mann-Whitney, Shapiro
pandas pandas.pydata.org/docs Cargar, limpiar, agrupar y describir
numpy numpy.org/doc Las simulaciones, el bootstrap y las permutaciones
statsmodels statsmodels.org Lo que sigue: regresión con sus intervalos y sus diagnósticos

Una nota sobre la última: statsmodels no se usa en este libro y es la que yo abriría después. scipy te da el valor p; statsmodels te da la tabla completa de un modelo, con coeficientes, intervalos y comprobaciones.

Los números del libro, en una tabla

Todo lo que se afirma aquí salió de ejecutar el código sobre las mismas 3.000 ventas. Este es el resumen, por si quieres comprobar alguno 🔍

CapítuloLo que salió
1El mes promedio se mueve 14,41%. El atajo dayfirst=True cambió 847 fechas
2Lima escrita de 4 formas. La media de id_venta es 11.499,50 y no significa nada
3Media 803,76 y mediana 533,63, con el 65,93% de las ventas por debajo del promedio
4Los 4 segmentos tienen desviaciones de 69,59 a 719,55 y el mismo CV de 0,37
5Shapiro da p = 0,4422 con 20 filas y 0,000000 con 1.000, sobre los mismos datos
6Los tres métodos de atípicos dan 32, 203 y 222. Las 32 de la z son 32 mayoristas
7El 72,40% de los mayoristas compra; el 31,33% de las compras son de mayoristas
8Ventas diarias: media 5,5866 y varianza 5,4146, la firma de una Poisson
9El intervalo del 95% con muestras chicas cubre el 93%
10De 10.000 mundos sin efecto, 155 dieron una diferencia así de grande
11Ciudad p = 0,9813; segmento p = 7,2e-42. Bodega tiene un residuo de +8,299
12Copiando los datos 10 veces, el p baja a 1,6e-15 y la d se queda en 0,1284
13Unidades y monto: r = 0,0178. Agregando por segmento: 0,5433
14Probando 20 subgrupos vacíos, el 64,0% de las veces sale algo significativo
15WhatsApp cierra 19,37 puntos más, y aguanta en los 4 segmentos

De dónde sale lo que este libro afirma

Los números salen de los datos, pero las ideas no son mías: cada una tiene un artículo detrás, casi siempre viejo y casi siempre más interesante que el resumen que circula 📚

Te los pongo por si alguna vez tienes que defender una de estas frases en una reunión. Que te discutan un criterio es normal; que te discutan a Fisher, ya no 💛

El valor p y de dónde salió el 0,05

  • 📐 Fisher, R. A. (1925). Statistical Methods for Research Workers. Aquí aparece el 0,05, y lo dice como lo que era: una conveniencia para las tablas impresas de la época, no una ley. Está entero en Classics in the History of Psychology.
  • ⚖️ Wasserstein, R. L. y Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129-133. doi.org/10.1080/00031305.2016.1154108. La Asociación Americana de Estadística tuvo que publicar seis principios sobre cómo NO leer un valor p. Es la fuente de casi todo el capítulo 12, y si solo vas a leer una cosa de esta lista, que sea esta.
  • 🚪 Wasserstein, R. L., Schirm, A. L. y Lazar, N. A. (2019). Moving to a World Beyond "p < 0.05". The American Statistician, 73(sup1), 1-19. doi.org/10.1080/00031305.2019.1583913. La continuación, tres años después: dejen de decir "estadísticamente significativo".

Por qué significativo no basta

  • 🔬 Ioannidis, J. P. A. (2005). Why Most Published Research Findings Are False. PLoS Medicine, 2(8), e124. doi.org/10.1371/journal.pmed.0020124. El título asusta y el argumento es aritmética: si buscas muchas hipótesis con poca potencia, la mayoría de lo que te salga significativo va a ser falso. Es el capítulo 17 escrito quince años antes.
  • 🎣 Simmons, J. P., Nelson, L. D. y Simonsohn, U. (2011). False-Positive Psychology. Psychological Science, 22(11), 1359-1366. doi.org/10.1177/0956797611417632. Los que demostraron el p-hacking haciéndolo: "probaron" que escuchar una canción te rejuvenece año y medio, con datos reales y sin mentir en ningún paso.
  • 🔁 Open Science Collaboration (2015). Estimating the Reproducibility of Psychological Science. Science, 349(6251). doi.org/10.1126/science.aac4716. Repitieron cien estudios publicados. Menos de la mitad volvió a salir.
  • 🌍 Cohen, J. (1994). The Earth Is Round (p < .05). American Psychologist, 49(12), 997-1003. doi.org/10.1037/0003-066X.49.12.997. Diez páginas explicando que el valor p no contesta lo que todo el mundo cree que contesta. Es de lo mejor escrito que hay sobre esto.

El tamaño del efecto y la potencia

  • 📏 Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2.ª ed.). De aquí salen la d del capítulo 14 y sus cortes de 0,2, 0,5 y 0,8, que él mismo presenta como convenciones provisionales.
  • 🔢 Benjamini, Y. y Hochberg, Y. (1995). Controlling the False Discovery Rate. Journal of the Royal Statistical Society B, 57(1), 289-300. doi.org/10.1111/j.2517-6161.1995.tb02031.x. La alternativa moderna a Bonferroni cuando comparas muchas cosas: en vez de volverse durísima, controla qué proporción de tus hallazgos son falsos.

Las pruebas que usamos, en su artículo original

  • 🍺 Student (Gosset, W. S.) (1908). The Probable Error of a Mean. Biometrika, 6(1), 1-25. doi.org/10.2307/2331554. La prueba t. Firmó como "Student" porque trabajaba en la cervecería Guinness y no lo dejaban publicar con su nombre.
  • ⚖️ Welch, B. L. (1947). The Generalization of Student's Problem when Several Different Population Variances are Involved. Biometrika, 34(1-2), 28-35. doi.org/10.1093/biomet/34.1-2.28. Esto es lo que estás pidiendo cada vez que escribes equal_var=False, que en este libro es siempre.
  • 🔔 Shapiro, S. S. y Wilk, M. B. (1965). An Analysis of Variance Test for Normality. Biometrika, 52(3-4), 591-611. doi.org/10.1093/biomet/52.3-4.591. La prueba del capítulo 5, la que se vuelve inútil con muchas filas.
  • 📊 Mann, H. B. y Whitney, D. R. (1947). On a Test of Whether one of Two Random Variables is Stochastically Larger than the Other. Annals of Mathematical Statistics, 18(1), 50-60. doi.org/10.1214/aoms/1177730491. La que se usa cuando la campana no aplica.
  • 🥾 Efron, B. (1979). Bootstrap Methods: Another Look at the Jackknife. Annals of Statistics, 7(1), 1-26. doi.org/10.1214/aos/1176344552. Las tres líneas del capítulo 10 tienen este artículo detrás.

Los errores clásicos, con nombre y apellido

  • 🔀 Simpson, E. H. (1951). The Interpretation of Interaction in Contingency Tables. Journal of the Royal Statistical Society B, 13(2), 238-241. doi.org/10.1111/j.2517-6161.1951.tb00088.x. La paradoja del capítulo 17.
  • 📈 Anscombe, F. J. (1973). Graphs in Statistical Analysis. The American Statistician, 27(1), 17-21. doi.org/10.1080/00031305.1973.10478966. Cuatro conjuntos de datos con la misma media, la misma varianza y la misma correlación, y completamente distintos al dibujarlos. Es el argumento del capítulo 15 en una página.

Y un aviso de honestidad, que va con el resto del libro: los enlaces apuntan al DOI oficial de cada artículo, no a una copia. Varios están detrás de un muro de pago de la revista, aunque casi todos se encuentran libres buscando el título. Los que sí están abiertos y completos son el de Ioannidis, el de la ASA, el de reproducibilidad y el de Fisher 🔓

Los tres caminos que siguen

Este libro cubre comparar grupos. Lo que viene después son tres cosas distintas, y cuál te toca depende de qué necesites 🛤️

1. Regresión. Todo el libro compara un factor cada vez. La regresión mira varios a la vez y te dice cuánto aporta cada uno con los demás fijos. Es lo que hacía falta en el capítulo 22 para separar el canal del segmento en un solo modelo. Está en statsmodels, y la versión que predice está en el libro de machine learning.

2. Inferencia causal. El capítulo 22 termina diciendo "esto es observacional". Hay un campo entero dedicado a cuándo se puede afirmar causalidad sin experimento, con herramientas como los grafos causales o las variables instrumentales. El libro moderno de referencia es Causal Inference: The Mixtape, de Scott Cunningham, que además es gratis en la web.

3. Estadística bayesiana. Todo lo que hicimos es "frecuentista": suponer que no pasa nada y ver qué tan raro es lo que viste. El enfoque bayesiano hace la pregunta al revés, que es la que uno quería hacer desde el principio: dada la evidencia, ¿qué probabilidad tiene cada valor?. El libro de referencia es Statistical Rethinking, de Richard McElreath.

Lo que este libro no cubre, y a propósito

  • 📈 Series de tiempo. Miramos meses, pero nunca tratamos el tiempo como tiempo: nada de estacionalidad, tendencia ni autocorrelación.
  • 🧪 Diseño de experimentos. El capítulo 14 calcula tamaños de muestra, pero un experimento de verdad tiene aleatorización, bloques y estratos.
  • 🧩 Modelos multinivel. Es la respuesta buena al problema del capítulo 17 de las filas que no son independientes.
  • 🔢 Análisis multivariante. Componentes principales, conglomerados y compañía.

Cómo se hizo este libro

Por si te sirve para los tuyos 🐣

Todo el código de este libro se ejecuta. Cada bloque corre sobre el mismo CSV y su salida se compara con la publicada, en una prueba automática que corre con el resto del sitio. Si una versión de pandas cambia un formato, la prueba falla y me entero yo antes que tú.

Eso explica varias cosas del libro que igual te llamaron la atención. Los números tienen cuatro decimales porque son los que salieron. Hay hallazgos que contradicen lo que yo esperaba y se quedaron publicados, como el del capítulo 17 donde contar clientes en vez de ventas mejoró el valor p en lugar de empeorarlo 😅

Y los errores de cada capítulo son errores de verdad: se ejecutan, revientan, y la prueba comprueba que revientan con el mensaje que dice el libro.

Los otros libros

Y ya está

Si te llevas una sola cosa de todo el libro, que sea la pregunta del capítulo 1, porque es la que hay detrás de los otros quince:

¿Esto que estoy viendo es real, o es lo que varía normalmente?

Ahora ya sabes contestarla con números. Gracias por llegar hasta aquí 💛

Si estás aplicando esto en tu empresa y quieres que lo veamos juntas, agenda una reunión o escríbeme por el formulario 🐣

¿Le sirve a alguien que conoces?

Pásale el libro. Es gratis, está entero y no pide registro 🐣

Instagram y TikTok no dejan compartir enlaces desde la web: esos dos copian la URL para que la pegues en tu historia.

¿Tienes alguna duda o consulta?