HABILIDADES NUMÉRICAS V - P4200-TEÓRICO-N0313-05-N01
Diagrama de temas
Recolección y organización de datos
Introducción
Recolectar y organizar datos es el primer eslabón del análisis: si se hace bien, las conclusiones serán confiables; si se hace mal, ningún cálculo posterior corregirá los sesgos de origen. Todo parte de un objetivo claro (qué decisión sostendrán los datos), seguido de la definición de variables observables, la delimitación de población y muestra, y la elección del instrumento de captura (encuesta breve, formulario, checklist). La calidad depende tanto del diseño como de la ejecución: preguntas comprensibles, tiempos razonables, canal de respuesta práctico y comunicación transparente sobre propósito y uso de la información.
La planeación traduce cada variable a una definición operativa: qué significa exactamente, en qué unidades se medirá y qué valores admite. Elegir la escala adecuada (categórica, ordinal o numérica) determina cómo se organizarán las respuestas y qué resúmenes son pertinentes. Conviene anticipar fuentes de error (muestras no representativas, preguntas sesgadas, digitación defectuosa) y atender la ética y privacidad: evitar datos sensibles innecesarios y custodiar los archivos con rigor.
Marco de muestreo
Es la descripción de a quién y dónde se pregunta (población accesible y lugares/canales de captura).
Datos crudos
Son las respuestas tal como se capturaron, sin limpieza ni transformación de ningún tipo.
Una encuesta rápida es un instrumento breve, normalmente entre una y cinco preguntas y está diseñada para responder con agilidad una decisión concreta, como elegir una presentación de producto o evaluar la satisfacción con el empaque. (Llinás Solano, H., 2017, pp. 10–66) Su fortaleza no reside en técnicas estadísticas sofisticadas, sino en la claridad del objetivo y en la precisión con que se formulan las preguntas.
El diseño de una encuesta parte de definir la variable a observar y la escala de medición adecuada: categórica, ordinal (Likert) o numérica. Las preguntas deben ser claras, neutras y con opciones exhaustivas y excluyentes, y se recomienda establecer desde el inicio la codificación de respuestas para facilitar la tabulación.
En la recolección de datos, aunque se use un muestreo por conveniencia (QR, tabletas, enlaces), es posible reducir sesgos diversificando horarios y lugares y documentando el . Además, una prueba piloto permite detectar ambigüedades y estimar tiempos. Registrar metadatos básicos (fecha, canal, ubicación) aporta trazabilidad.
Figura 1
Recolección de datos en campo
Nota. QuestionPro. (2023, septiembre). Recolección de datos en campo [Imagen]. QuestionPro Blog. https://www.questionpro.com/blog/wp-content/uploads/2023/09/2505-Portada-recoleccion-de-datospg
La calidad del dato se protege mediante validaciones simples en el formulario: listas cerradas, límites claros en escalas Likert y rangos numéricos definidos. También es recomendable añadir una nota ética sobre propósito y anonimato y evitar preguntas sensibles.
En conjunto, una encuesta rápida bien diseñada ofrece un equilibrio entre costo y valor, con datos limpios, comparables y trazables, evitando retrabajos y sesgos para convertirse en un insumo confiable para la gestión.
Figura
Estadística descriptiva y estadística inferencial
Nota. DATAtab. (s. f.). Estadística descriptiva y estadística inferencial [Imagen]. DATAtab. https://datatab.es/assets/tutorial/Estad%C3%ADstica_descriptiva_y_estad%C3%ADstica_inferencial.png
Profundiza más
Este recurso te ayudará a enfatizar sobre Diseño de cuestionarios. ¡Accede aquí!
Una tabla de frecuencia es el puente entre y conclusiones. Toma un conjunto de observaciones y lo resume en recuentos (frecuencia absoluta), proporciones (frecuencia relativa) y acumulados, de modo que se vea la distribución sin perder el sentido de escala. La idea central es sencilla: para cada categoría (si la variable es cualitativa) o cada intervalo (si es cuantitativa) se contabiliza cuántas veces aparece, se divide por el total n para obtener la proporción.
Para esto se puede expresar la frecuencia absoluta, relativa y acumulados de la siguiente manera:
n es el número de datos obtenidos, entonces, si se realizó una encuesta y tenemos 30 respuestas, n=30, fi, es cuántos de esos datos caen en una categoría o intervalo específico, Por ejemplo, si 12 personas prefieren la respuesta “Sí” en la primera pregunta, entonces fi=12. Fíjate que n es todo, mientras que fi es una parte de ese todo. Por eso, si sumas todas las fi de la tabla (todas las categorías o intervalos), debe darte exactamente n.
La frecuencia relativa responde a la pregunta: “¿qué parte del total representa esa categoría?” y se calcula dividiendo:
\[
f_{ri} = \frac{f_i}{n}
\]
Y se puede expresar también como porcentaje al multiplicarlo por 100, con el ejemplo anterior podemos decir que para la pregunta 1:
\[
f_{ri} = \frac{12}{30} = 0.4 = 40\%
\]
La frecuencia acumulada es “¿cuántos van sumando hasta aquí?” Se obtiene sumando los f_i desde la primera fila hasta la fila actual. Su versión relativa acumulada (o porcentual acumulada) te dice “¿qué fracción del total acumulo hasta aquí?”. Esto es muy útil para frases como “el 70 % termina en 12 minutos o menos” cuando trabajas con intervalos de tiempo.
Un par de comprobaciones rápidas para confiar en los resultados es que: la suma de todas las frecuencias absolutas debe ser n, la suma de porcentajes debe dar muy cerca de 100 % (puede quedar 99.9 % o 100.1 % por redondeo) y ninguna fila debería tener valores “imposibles” (por ejemplo, tiempos negativos). También se debe tomar en cuenta que n es tu universo o los datos que tienes, cada fi es la parte que corresponde a una categoría o intervalo, y fri% te dicen qué tan grande es esa parte respecto del todo.
A continuación se presenta una tabla de frecuencias con un ejemplo donde nuestro universo ¨n¨=30.
Tabla 1
Tabla de frecuencia
Medio de transporte
fif_i
fri = fi/n
%
FiF_i
% acum.
A pie
6
0.20
20.0%
6
20.0%
Bicicleta
4
0.1333
13.3%
10
33.3%
Bus
12
0.40
40.0%
22
73.3%
Auto
8
0.2667
26.7%
30
100.0%
Total
30
1
100.0%
—
—
Nota. En la tabla se muestran frecuencias con un universo de 30. Creación propia.
La validación de datos es el filtro previo al análisis que asegura corrección, coherencia y completitud. Comienza por la forma: que los números estén como números y las fechas como fechas y que las categorías provengan de listas cerradas para evitar variantes de escritura, también se debe tener en cuenta que existan rangos razonables (por ejemplo, escalas 1–5 en cuestionarios o edades entre 0 y 120).
Aquí te presentamos una tabla de lo que debes tener en cuenta para validar datos obtenidos en encuestas.
Tabla 2
Elementos a tener en cuenta en la validación de datos
Ítem
Qué revisar
Cómo verificar
Señal de alerta
Tipos y formatos
Números como números; fechas como fechas; textos limpios
Validación de datos (número, fecha), ESNUMERO, ISTEXTO, ESPACIOS, LIMPIAR
Números con texto mezclado, fechas inválidas (31/02), caracteres invisibles
Rangos válidos
Límites razonables según la variable
Reglas “entre… y…”, mensajes de error claros
Edades negativas o > límite; escalas fuera de 1–5
Listas/catálogos
Categorías controladas y consistentes
Validación “Lista”, catálogos de referencia
Variantes de escritura (“Auto”, “auto”, “AUTOS”)
Unicidad/duplicados
IDs únicos y combinaciones clave sin repetición
CONTAR.SI o CONTAR.SI.CONJUNTO sobre la clave
Registros repetidos o claves duplicadas
Reglas condicionales
Campos obligatorios según otra respuesta
Validación personalizada (SI/ENTONCES), reglas de negocio
“Acepta = Sí” sin fecha; modalidad virtual sin enlace
Cronología
Orden temporal coherente
Comparación de fechas/horas (fin > inicio)
Fin anterior al inicio; duraciones negativas
Coherencia numérica
Sumas, porcentajes y totales
Reconciliar totales; suma fᵢ = n; % ≈ 100 %
Totales que no cuadran; % alejados de 100 %
Valores perdidos
Política clara de faltantes
Codificar “No responde”; documentar exclusiones
Nulos en campos críticos sin justificación
Metadatos
Trazabilidad de captura
Registrar fecha, hora, canal, versión del formulario
Imposible reproducir el origen del dato
Versionado y bitácora
Rastro de cambios
Hoja “cruda” y “curada”; log de transformaciones
Correcciones sin registro ni motivo
Nota. Aquí se muestra los elementos a tener en cuenta cuando se valida datos. Creación propia.
Tipos y formatos
Números como números; fechas como fechas; textos limpios → Validación de datos (número, fecha), ESNUMERO, ISTEXTO, ESPACIOS, LIMPIAR → Números con texto mezclado, fechas inválidas (31/02), caracteres invisibles
Rangos válidos
Límites razonables según la variable → Reglas “entre… y…”, mensajes de error claros → Edades negativas o > límite; escalas fuera de 1–5
Listas/catálogos
Categorías controladas y consistentes → Validación “Lista”, catálogos de referencia → Variantes de escritura (“Auto”, “auto”, “AUTOS”)
Unicidad/duplicados
IDs únicos y combinaciones clave sin repetición → CONTAR.SI o CONTAR.SI.CONJUNTO sobre la clave → Registros repetidos o claves duplicadas
Reglas condicionales
Campos obligatorios según otra respuesta → Validación personalizada (SI/ENTONCES), reglas de negocio → “Acepta = Sí” sin fecha; modalidad virtual sin enlace
Cronología
Orden temporal coherente → Comparación de fechas/horas (fin > inicio) → Fin anterior al inicio; duraciones negativas
Coherencia numérica
Sumas, porcentajes y totales → Reconciliar totales; suma fᵢ = n; % ≈ 100 % → Totales que no cuadran; % alejados de 100 %
Valores perdidos
Política clara de faltantes → Codificar “No responde”; documentar exclusiones → Nulos en campos críticos sin justificación
Metadatos
Trazabilidad de captura → Registrar fecha, hora, canal, versión del formulario → Imposible reproducir el origen del dato
Versionado y bitácora
Rastro de cambios → Hoja “cruda” y “curada”; log de transformaciones → Correcciones sin registro ni motivo
También es importante identificar los valores atípicos y filtrarlos, existen diferentes maneras de identificar este tipo de datos y diferentes fórmulas que podemos usar, algunos valores atípicos se pueden notar gráficamente pero siempre es recomendable usar fórmulas para tener mejor precisión al filtrar este tipo de valores.
Figura 3
Valores Atípicos
Nota. Figura que resalta una gráfica con valores atípicos. Creación propiapie_pagina
Profundiza más
Este recurso te ayudará a enfatizar sobre Manual básico de estadística. ¡Accede aquí!