Tema
Preparación del texto para análisis
Instrucciones
Recolectar un dataset textual de al menos 80 registros vinculados con ciberseguridad.
Documentar la fuente del corpus y su estructura.
Aplicar un proceso de limpieza y normalización que podrá incluir: eliminación de HTML, URLs, firmas, duplicados, manejo de mayúsculas y minúsculas, supresión de stopwords, lematización o stemming, según la pertinencia del caso.
Presentar un informe técnico en el que se justifique cada decisión de preprocesamiento
Desarrollar un análisis exploratorio del conjunto de datos, con distribución léxica básica, frecuencias y patrones lingüísticos asociados a amenazas.
Explicar cómo este dataset preparado servirá como base para los retos posteriores
Tipo de entrega
Archivo comprimido .ZIP que contenga:
Dataset original en CSV, XLSX o JSON
Dataset limpio en CSV, XLSX o JSON
Informe técnico en PDF o DOCX