Este curso trata de los fundamentos de la estadística e introduce al estudiante en el uso de herramientas tecnológicas apropiadas para su implementación. Este curso parte de conceptos básicos como poblaciones y muestra, la teoría del muestreo , tipos de variables, correlación y pruebas de hipótesis , diseño de experimentos y de distribuciones de tipo continuas y discretas.
En la segunda parte cubre la creación de modelos de predicción lineal simple, múltiple y logística. Los modelos son analizados usando múltiples métricas que permitan al analista perfeccionar el modelo ya sea ajustando las variables o mediante métodos de regularización.
RESULTADOS DE APRENDIZAJE
RDA 1: Identificar los conceptos de la Estadística Descriptiva e Inferencial que sustentan el desarrollo de procesos estadísticos.
Criterio de evaluación 1: Realizar un análisis descriptivo del dataset mediante estadísticos y agregaciones que conduzcan a identificar y justificar variables pertinentes causantes de las demoras.
RDA 2: Calcular e interpretar estadísticos y parámetros para describir muestras y poblaciones.
Criterio de evaluación 1: Identificar la distribución que siguen las variables estudiadas realizando diversas pruebas de hipótesis.
RDA 3: Analizar información contextual sobre hábitat, infraestructura y movilidad, mediante técnicas estadísticas descriptivas e inferenciales, para la adecuada toma de decisiones.
Criterio de evaluación 1: Aplicar técnicas de regresión lineal y múltiple para crear modelos candidatos que consideren un subset de las variables identificadas anteriormente como pertinentes.
Criterio de evaluación 2: Aplicar diversas técnicas para estimar la bondad de los modelos a fin de comparar ventajas y desventajas de cada uno de ellos.
El proyecto final es la evaluación sumativa de los 3 retos, se considera como el entregable final de la asignatura.
Objetivo General
Desarrollar un modelo estadístico que permita predecir la probabilidad de demora en salida de vuelos de aeropuertos de NY, basado en condiciones ambientales y otros parámetros contenidos en el dataset.
Objetivos Específicos
Realizar análisis exploratorio de los datos (EDA) tendientes a determinar la necesidad de implementar limpieza de datos, normalizaciones, imputaciones, o simplemente comprender su comportamiento por grupos o subgrupos mediante visualizaciones simples.
Creación de pruebas de hipótesis y otras pruebas de contraste que permitan inferir el comportamiento de la población.
Creación de modelos lineales o logísticos mediante el análisis de las variables que demuestren correlación y causación utilizando pruebas y visualizaciones adecuadas.
Descripción del Proyecto
El proyecto consiste en desarrollar un modelo de predicción que permita predecir la probabilidad de que un vuelo presente demoras en la salida del mismo, basado en información histórica y otras variables ambientales que pudieran tener un impacto.
Actividades
Reto
Actividades
Reto 1
Realizar un análisis descriptivo del dataset
Realizar agregaciones que conduzcan a identificar y justificar variables pertinentes causantes de las demoras
Identificar actividades de preprocesamiento que deban implementarse sobre la data
Reto 2
Realizar pruebas linealidad y normalidad para variables continuas
Realizar pruebas pertinencia para variable nominales para variables nominales
Realizar pruebas de hipótesis
Reto 3
Aplicar técnicas de regresión lineal
Aplicar técnicas de regresión logística
Analizar el comportamiento de los modelos en base a predicción
Reto 4
Obtener múltiples métricas como indicadores de la bondad los distintos modelos
Aplicar técnicas de regresión logística
Aplicar técnicas de comparación de modelos
Metodología (CRISP-DM)
Entendimiento de la data: Incluye recolección de la data, análisis descriptivo de la data , EDA y verificación de la calidad de la misma
Preparación de la data: determinar qué conjuntos de datos se utilizarán y documentar los motivos de inclusión o exclusión, limpieza de datos, transformaciones que deben hacerse sobre los datos
Modelado: Revisar las técnicas de modelado y seleccionar la más apropiada, diseño de subsets de prueba y validación, construcción de modelos y validación
Cada reto corresponde a una entrega parcial del proyecto.
Criterios de Evaluación del proyecto
Criterio
Ponderación
Detalle
Funcionalidad completa
40%
Cumplimiento de los 4 retos
Documentación del código mediante archivos RMD o Jupyter
35%
Uso de funciones, bucles y condicionales de manera eficiente.
Manejo de archivos
25%
Eficiencia del modelo en la predicción
Cronograma de entregables del Proyecto
Semana
Reto
Entregable
Contenido
4
Reto 1
Análisis exploratorio completo
Estadística descriptiva de los datos y visualización de los mismos
8
Reto 2
Pruebas de hipótesis y pruebas de contraste
Desarrollo de la pruebas y entendimiento de los resultados
12
Reto 3
Modelos
Desarrollo de modelos y análisis inicial de la calidad de este
16
Reto 4
Comparación de modelos
Técnicas aplicadas para comparar los distintos modelos candidatos
Retos de aprendizaje de la asignatura
RETO 1: Análisis descriptivo del dataset mediante estadísticos y agregaciones que conduzcan a identificar y justificar variables pertinentes causantes de las demoras
Objetivo: Analizar todas las variables del dataset, establecer sus principales estadísticos, visualizar la data.
Indicaciones:
Entender los distintos tipos de datos:
Variables cuantitativas: discretas y continuas
Variables cualitativas: nominales y ordinales
Medidas de tendencia central:
Distintos tipos de medias
Máximos, mínimos y rangos
Medidas de dispersión:
Cuantiles
Varianzas y distribución
RETO 2: Identificar la distribución que siguen las variables estudiadas realizando diversas pruebas de hipótesis
Objetivo: Entender las variables en términos de distribuciones de distinto tipo.
Indicaciones:
Identificación del tipo de variables:
Cualitativas y cuantitativas
Establecer relaciones entre variables:
Aplicar medidas de correlación y covarianza
Visualizar las relaciones
Aplicación de pruebas de contraste:
Establecer hipótesis sobre la población
Hipótesis de un lado y de dos lados
RETO 3: Aplicar técnicas de regresión lineal y múltiple para crear modelos candidatos que consideren un subset de las variables identificadas anteriormente como pertinentes
Objetivo: Crear modelos basados en distintos subsets de variables.
Indicaciones:
Aplicar regresiones lineales múltiples o regresiones logísticas
Analizar resultados iniciales de residuos
Analizar incertidumbre de coeficientes
Validación de los modelos mediante técnicas de validación cruzada:
Uso de particiones nfold
Obtener métricas de rendimiento:
R², R² ajustado
Error estándar residual
RETO 4: Aplicar diversas técnicas para estimar la bondad de los modelos a fin de comparar ventajas y desventajas de cada uno de ellos