Diagrama de temas
-
PROCESAMIENTO LENGUAJE NAT. V - P1109-TEÓRICO-PRACTICO-N0073-06-N01
PRIMER NIVEL
RAFAEL MELGAREJO HEREDIA
—
-
Análisis semántico e intención maliciosa
-
Introducción
Hasta este punto del curso, los estudiantes han aprendido a procesar texto, representarlo computacionalmente y construir modelos capaces de clasificar mensajes según su tipo de amenaza. Sin embargo, muchos ataques reales no utilizan palabras clave evidentes ni patrones superficiales fáciles de detectar. En contextos de ciberseguridad, los atacantes suelen emplear lenguaje ambiguo, indirecto o cuidadosamente diseñado para evadir filtros automáticos. Por esta razón, la Semana 6 introduce un cambio fundamental de enfoque: pasar de la detección basada en palabras a la comprensión del significado del lenguaje, es decir, al análisis semántico.
El análisis semántico permite identificar no solo qué palabras aparecen en un texto, sino qué intención comunica el mensaje. En este sentido, el curso profundiza en conceptos como la intención comunicativa, la pragmática del lenguaje y las señales discursivas de manipulación, elementos clave en ataques de ingeniería social. Además, se introducen técnicas avanzadas como los embeddings semánticos, que permiten representar el significado del texto en espacios vectoriales, y métodos para detectar anomalías lingüísticas que pueden indicar comportamientos maliciosos. Finalmente, se explora el uso de heurísticas híbridas, que combinan reglas lingüísticas y modelos de aprendizaje automático para mejorar la detección de amenazas. De esta manera, la Semana 6 marca la transición hacia sistemas de PLN más sofisticados, capaces de identificar ataques incluso cuando estos no siguen patrones explícitos.
Detección de anomalías lingüísticas
Una anomalía lingüística es una desviación respecto al uso normal del lenguaje dentro de un contexto específico. En ciberseguridad, estas anomalías pueden indicar que un mensaje no sigue los patrones habituales de comunicación de una organización, lo cual puede ser una señal de actividad maliciosa.
Heurísticas híbridas
Las heurísticas híbridas son estrategias que integran múltiples fuentes de información para mejorar la detección. Permiten construir sistemas más robustos frente a ataques reales.
-
6.1. Palabras clave vs. semántica.6.2. Intención comunicativa y pragmática.
6.1.1. Limitaciones de la detección basada en palabras clave
En las primeras etapas del análisis de texto, muchos sistemas de detección de amenazas utilizan enfoques basados en palabras clave. Este método consiste en identificar términos específicos que suelen aparecer en mensajes maliciosos, como: urgente, verifique, contraseña, suspensión, acceso, confirme
Este enfoque es simple y computacionalmente eficiente, y puede ser útil para detectar patrones evidentes de ataques como el phishing. Sin embargo, presenta una limitación crítica: depende de la presencia explícita de ciertas palabras. En contextos reales de ciberseguridad, los atacantes suelen adaptar su lenguaje para evitar estos filtros. Por ejemplo:
- “Revise su acceso a la plataforma” en lugar de “verifique su cuenta”.
- “Se recomienda actualizar sus datos” en lugar de “actualice sus credenciales”.
Aunque el significado es similar, las palabras clave pueden no coincidir, lo que reduce la capacidad de detección del sistema.
6.1.2. Hacia el análisis semántico
Para superar estas limitaciones, es necesario avanzar hacia el análisis semántico, que busca comprender el significado del texto más allá de las palabras individuales.
El enfoque semántico permite reconocer que diferentes expresiones pueden transmitir la misma intención, como por ejemplo:
- "verifique su cuenta"
- "confirme su acceso"
- "valide sus credenciales"
Aunque utilizan palabras distintas, todas expresan una misma acción solicitada al usuario, lo cual puede ser indicativo de un intento de manipulación.
6.1.3. Diferencia conceptual (Einsenstein,2019)
ENFOQUE CARACTERÍSTICA PRINCIPAL LIMITACIÓN PALABRAS CLAVE Busca términos específicos Fácil de evadir SEMÁNTICA Analiza significados del mensaje Mayor complejidad PALABRAS CLAVECaracterística principal: Busca términos específicos
Limitación: Fácil de evadir
SEMÁNTICACaracterística principal: Analiza significados del mensaje
Limitación: Mayor complejidad
Ejemplo comparativo: supongamos el siguiente texto: “Por favor valide su acceso a la plataforma corporativa”. Entonces:
- Al aplicar el método basado en palabras clave, el sistema busca únicamente ciertas palabras como “verifique”, como no la encuentra, no detecta la amenaza.
- Con el método semántico, el sistema detecta posible intento de ingeniería social, porque interpreta
- acción solicitada: validación de acceso
- contexto: cuenta o sistema
- intención: interacción del usuario
6.1.4. Implicaciones en ciberseguridad
El uso exclusivo de palabras clave puede generar dos problemas:
- Falsos negativos: ataques que no contienen términos explícitos
- Falsos positivos: mensajes legítimos con palabras “sospechosas”
El análisis semántico reduce estos problemas al considerar el contexto y la intención del mensaje.
6.1.5. Implementación básica en Python
En ilustración 1: sistema basado en palabras clave. Resultado: “False”.
Figura 1
Python: Sistema basado en palabras clave

Nota. Python: Sistema basado en palabras clave (creación de autor Rafael Melgarejo) En ilustración 2: enfoque con vectorización semántica. El resultado “[[0.20199]]”, indicando que los textos tienen un nivel de similaridad semántica, aunque no compartan las mismas palabras. Es decir, las palabras pueden cambiar pero la intención permanece.
Figura 2
Vectorización Semántica

Nota. Vectorización Semántica (creación de autor Rafael Melgarejo) 6.3. Señales de ingeniería social.En el análisis semántico no basta con identificar el significado literal de las palabras; es necesario comprender qué intención tiene el emisor del mensaje. Este enfoque corresponde al estudio de la intención comunicativa, que busca responder:
¿Qué acción intenta provocar este mensaje en el receptor?
En ciberseguridad, esta pregunta es fundamental, ya que muchos ataques no dependen únicamente del contenido textual, sino del efecto que buscan generar en el usuario.
6.2.1. Pragmática del lenguaje
Es la rama de la lingüística que estudia cómo el contexto influye en la interpretación del lenguaje. En otras palabras, analiza cómo se usa el lenguaje en situaciones reales. Esto implica que el significado de un mensaje no depende solo de las palabras, sino también de:
- el contexto en el que se emite,
- la relación entre emisor y receptor,
- la intención detrás del mensaje.
Aprende más
Para conocer más sobre (La INTENCIÓN COMUNICATIVA DE UN TEXTO explicada con ejemplos), puedes ver el video de YouTube ¡Accede aquí!
6.2.2. Tipos de intención en cyberseguridad
El análisis semántico permite ubicar un mensaje dentro del espectro de intenciones (Jurafsky, 2023).
TIPO DE INTENCIÓN EJEMPLO RIESGO INFORMATIVA El sistema estará en mantenimiento Bajo LEGÍTIMO Ingrese al sistema para revisar su cuenta Medio PERSUASIVO Debe actualizar sus datos ahora Alto MANIPULATIVO Si no actúa, su cuenta será suspendida Crítico INFORMATIVAEjemplo: El sistema estará en mantenimiento
Riesgo: Bajo
LEGÍTIMOEjemplo: Ingrese al sistema para revisar su cuenta
Riesgo: Medio
PERSUASIVOEjemplo: Debe actualizar sus datos ahora
Riesgo: Alto
MANIPULATIVOEjemplo: Si no actúa, su cuenta será suspendida
Riesgo: Crítico
6.2.3. Actos de habla
Desde la teoría lingüística, los mensajes pueden clasificarse como actos de habla, es decir, acciones realizadas a través del lenguaje. En ciberseguridad, los más relevantes son:
- Directivos → buscan que el usuario haga algo
- Comisivos → prometen una acción (ej. recompensa)
- Asertivos → presentan información como verdadera
6.2.4. Implicaciones para el análisis automático.
Un sistema basado solo en palabras puede no detectar diferencias entre ambos textos. Sin embargo, un sistema que incorpora análisis pragmático puede identificar:
- nivel de urgencia
- presencia de coerción
- tipo de acción solicitada
Esto permite detectar intenciones maliciosas incluso cuando el lenguaje es sutil.
6.2.5. Representación computacional de la intención
En PLN, la intención puede modelarse mediante:
- patrones lingüísticos (ej. verbos imperativos),
- estructuras sintácticas,
- embeddings semánticos,
- modelos de clasificación de intención.
Una lógica como de ilustración 3, puede combinarse con modelos de ML.
Figura 3
Lógica para la intención

Nota. Lógica para la intención (creación de autor Rafael Melgarejo) 6.4. Embeddings y similitud semántica.Las señales de ingeniería social son patrones lingüísticos y discursivos diseñados para manipular el comportamiento del usuario, explotando sesgos cognitivos como el miedo, la urgencia, la autoridad o la confianza. A diferencia de los ataques puramente técnicos, la ingeniería social se basa en el uso estratégico del lenguaje para inducir decisiones rápidas o poco reflexivas.
En términos de PLN, estas señales no siempre se detectan por palabras específicas, sino por combinaciones de intención, tono y contexto, lo que las convierte en un problema ideal para el análisis semántico.
6.3.1. Principales categorías de señales
- Urgencia artificial: Mensajes que presionan al usuario a actuar rápidamente, reduciendo su capacidad de análisis crítico.
- Suplantación de autoridad: El atacante se hace pasar por una entidad legítima (banco, empresa, administrador del sistema).
- Persuasión emocional o coercitiva: Se apela a emociones como miedo, recompensa o culpa.
6.3.2. Implementación Python
Ilustración 4 ejemplifica una detección automática de señales. Mientras el score sea más alto, hay mayor probabilidad de ataque y viceversa.
Figura 4
Detección automática de señales

Nota. Detección automática de señales (creación de autor Rafael Melgarejo) 6.5. Detección de anomalías lingüísticas.6.4.1. Embedding
Es una representación vectorial del lenguaje que permite capturar el significado semántico de palabras, frases o textos completos en un espacio matemático. A diferencia de representaciones como BoW o TF-IDF (que se basan en frecuencia de palabras), los embeddings buscan representar relaciones de significado. En términos simples:
palabra → vector numérico → significado en el espacio semántico Esto permite que palabras o frases con significados similares estén cercanas entre sí en el espacio vectorial, incluso si no comparten términos exactos.
6.4.2. Tipos de Embeddings
Según el nivel de complejidad (Jurafsky,2023). Para ciberseguridad, los más útiles suelen ser los sentence embeddings, ya que permiten analizar mensajes completos. En ciberseguridad los embeddings permiten
- detectar ataques sin palabras clave explícitas
- identificar patrones de lenguaje similares
- agrupar mensajes sospechosos
- mejorar clasificadores de texto
TIPO CARACTERÍSTICA WORD EMBEDDINGS Representan palabras individuales (Word2Vec, GloVe) SENTENCE EMBEDDINGS Representan frases completas CONTEXTUAL EMBEDDINGS Consideran el contexto (BERT, transformers) WORD EMBEDDINGSCaracterística: Representan palabras individuales (Word2Vec, GloVe)
SENTENCE EMBEDDINGSCaracterística: Representan frases completas
CONTEXTUAL EMBEDDINGSCaracterística: Consideran el contexto (BERT, transformers)
Los embeddings tienen limitaciones como:
- requieren mayor capacidad computacional
- pueden ser difíciles de interpretar
- necesitan datasets representativos
6.4.3. Similitud semántica
Una vez que los textos están representados como vectores, se puede medir su similitud mediante métricas como la similitud del coseno:
- similitud ≈ 1 → textos muy similares
- similitud ≈ 0 → textos diferentes
Esto permite detectar:
- variantes de ataques
- reformulaciones del mismo mensaje
- intentos de evasión
Aprende más
Para conocer más sobre (“Qué son las BÚSQUEDAS SEMÁNTICAS y los EMBEDDINGS: IA con tu base de datos” ), puedes ver el video de YouTube ¡Accede aquí!
6.4.4. Ejemplo práctico en Python
La interpretación del texto ejemplo en el código de Ilustración 5 es:
- alta similitud entre textos maliciosos
- baja similitud entre texto malicioso y legítimo
Figura 5
Implementación de Vectorización y Similaridad de Coseno

Nota. Implementación de Vectorización y Similaridad de Coseno (creación de autor Rafael Melgarejo) 6.6. Modelado de intención e heurísticas híbridas.Una es una desviación respecto al uso normal del lenguaje dentro de un contexto específico. En ciberseguridad, estas anomalías pueden indicar que un mensaje no sigue los patrones habituales de comunicación de una organización, lo cual puede ser una señal de actividad maliciosa.
A diferencia de la detección por palabras clave o incluso por semántica directa, este enfoque se basa en identificar lo inusual, es decir:
¿Qué tiene este mensaje que no encaja con el comportamiento normal?
6.5.1. Tipos de anomalías en ciberseguridad
- Léxicas: uso de palabras, relacionado con: vocabulario inusual, términos fuera del dominio organizacional, combinaciones poco frecuentes.
- Sintácticas (estructura): construcciones gramaticales atípicas, errores de redacción, estructuras no habituales.
- Discursivas (tono e intención): cambios abruptos de tono mezcla de formalidad e informalidad, urgencia inesperada.
- Contextuales: mensajes fuera de horario, solicitudes inusuales par el rol del usuario, cambios en patrones de comunicación.
6.5.2. Enfoques de detección
Se listan algunos enfoques. Ilustración 6 muestra implementación simple en Python.
- Basado en reglas: se definen patrones de comportamiento sospechoso.
- Basado en estadísticas: se analizan distribuciones del lenguajes: frecuencia de palabras, longitud de mensajes, patrones de uso.
- Basado en embeddings: se compara el mensaje con el lenguaje típico.
- Modelos de detección de Anomalías:
- Isolation Forest
- One-Class SVM
- Autoencoders
Figura 5
Ejemplos de Detección de Anomalías

Nota. Ejemplos de Detección de Anomalías (creación de autor Rafael Melgarejo) 6.5.3. Relación con reto 3
El reto 2 clasifica amenazas conocidas, el reto 3 detecta patrones no evidentes (amenazas desconocidas). Como apoyo al reto 3, ilustración 7 tiene un ejemplo práctico en Python:
Figura 7
Ejemplo práctico en Python

Nota. jemplo práctico en Python (creación de autor Rafael Melgarejo) Consiste en identificar automáticamente qué quiere lograr un mensaje, es decir, clasificar la intención comunicativa del texto (informar, solicitar, persuadir, manipular, etc.). En ciberseguridad, este proceso es clave porque muchos ataques no se distinguen por su forma, sino por su propósito. El objetivo del modelado de intención es transformar este análisis en un proceso automatizable mediante PLN.
6.6.1. Tipos de intención relevantes en ciberseguridad (Eisenstein,2019)
Un sistema puede clasificar mensajes según su intención:
INTENCIÓN DESCRIPCIÓN NIVEL DE RIESGO Informativa Comunica un hecho Bajo Solicitud Pide una acción Medio Persuasiva Intenta convencer Alto Coercitiva Presiona o amenaza Crítico InformativaDescripción: Comunica un hecho
Nivel de riesgo: Bajo
SolicitudDescripción: Pide una acción
Nivel de riesgo: Medio
PersuasivaDescripción: Intenta convencer
Nivel de riesgo: Alto
CoercitivaDescripción: Presiona o amenaza
Nivel de riesgo: Crítico
6.6.2. ¿Por qué no basta un solo enfoque?
Ningún método por sí solo es suficiente:
- Palabras clave → fácilmente evadibles
- Modelos ML → requieren muchos datos
- Reglas → poco flexibles
Por ello, se utilizan que combinan:
reglas lingüísticas + modelos de aprendizaje automático + análisis semántico
6.6.3. Heurísticas híbridas
Las heurísticas híbridas son estrategias que integran múltiples fuentes de información para mejorar la detección. Ejemplo de combinación:
- embeddings → capturan significado
- reglas → detectan patrones específicos
- métricas → evalúan riesgo
Esto permite construir sistemas más robustos frente a ataques reales. Ejemplo: en el mensaje: “"El equipo de seguridad solicita validar su cuenta inmediatamente". El sistema puede analizar:
- autoridad → "equipo de seguridad"
- acción → "validar"
- urgencia → "inmediatamente"
Ilustración 8 presenta una implementación simple de heurística híbrida:
Figura 8
Heurística híbrida

Nota. Heurística híbrida (creación de autor Rafael Melgarejo) 6.6.4. Extensión con embeddings
Se puede combinar con similitud semántica:
if similitud_con_ataques > umbral:
score += 1
Esto permite detectar:
- variantes de ataques
- lenguaje evasivo
- mensajes reformulados
6.6.5. Ventajas y desventajas del enfoque híbrido
El objetivo del enfoque híbrido es detectar ataques no es solo clasificar textos, es entender la intención detrás del lenguaje. Este enfoque tiene sus ventajas y desventajas:
- Ventajas
- mayor robustez ante evasión
- mejor interpretación del lenguaje
- adaptable a diferentes contextos
- útil con pocos datos
- Desventajas
- requiere diseño cuidadoso de reglas
- puede ser difícil de mantener
- necesita calibración de umbrales
6.6.6. Articulación del contenido con los retos:
La integración de los tres primeros retos del curso responde a una lógica progresiva de construcción de un sistema de PLN aplicado a ciberseguridad, donde cada reto desarrolla un componente fundamental que luego se articula en una solución más compleja.
- En el Reto 1, se establece la base del sistema mediante la recolección, limpieza y comprensión del texto. Aquí el estudiante transforma datos no estructurados (correos, logs, reportes) en un dataset preparado y analizable, identificando patrones lingüísticos iniciales. Este paso es crítico, ya que la calidad de los datos condiciona el desempeño de cualquier modelo posterior.
- En el Reto 2, sobre esta base, se construye el primer componente funcional: un clasificador automático de amenazas. El estudiante aplica técnicas de vectorización (como TF-IDF o embeddings) y entrena modelos capaces de distinguir entre distintos tipos de mensajes (phishing, legítimos, etc.). Este reto introduce la capacidad de detección automática basada en patrones aprendidos.
- Al momento, el Reto 3 amplía el sistema hacia un nivel más avanzado mediante el análisis semántico y la detección de intención maliciosa. Aquí se incorporan técnicas para identificar mensajes evasivos, ambiguos o reformulados, utilizando embeddings, detección de anomalías y heurísticas híbridas. Este componente permite superar las limitaciones de los modelos basados únicamente en clasificación.
En conjunto, los tres retos se integran como un pipeline:
Datos → Preparación → Clasificación → Análisis semántico
donde cada etapa aporta una capa de inteligencia. Esta integración constituye la base directa para el Reto 4, en el que todos estos componentes se consolidan en un sistema completo de alerta temprana para ciberseguridad.
-
Recursos
-
-
Actividades
-