Tema
Bases del texto y del dataset en ciberseguridad
Instrucciones
Seleccionar un corpus pequeño de entre 20 y 30 textos relacionados con ciberseguridad, tales como correos sospechosos, tickets de soporte, fragmentos de logs narrativos o mensajes de alerta.
A partir de este conjunto, describir la fuente de los datos, el tipo de texto, la cantidad de registros y los campos disponibles.
Analizar los conceptos fundamentales de PLN aplicados al corpus, identificando qué constituye un token, qué elementos representan ruido, qué palabras o expresiones podrían funcionar como patrones de amenaza y qué problemas iniciales de calidad presenta el dataset.
Incorporar una breve reflexión sobre privacidad, anonimización y uso ético de la información, y propondrá una estrategia preliminar de preprocesamiento del corpus.
Tipo de entrega
Archivo en PDF o DOCX. Extensión sugerida: 2 a 3 páginas.