Desmitificando la Arquitectura Transformer: Cómo "Attention Is All You Need" Cambió la IA

22 de septiembre de 2026 | Por Jair Manuel Poveda Frago
Desmitificando la Arquitectura Transformer: Cómo "Attention Is All You Need" Cambió la IA

Desmitificando la Arquitectura Transformer: Cómo "Attention Is All You Need" Cambió la IA

La Inteligencia Artificial experimentó un cambio de paradigma radical con la publicación del célebre artículo científico "Attention Is All You Need" de Vaswani y sus colaboradores. Antes de este estudio, el procesamiento del lenguaje natural dependía de modelos que leían el texto de forma secuencial: palabra por palabra. El Transformer eliminó por completo la recurrencia secuencial, demostrando que un mecanismo llamado Autoatención (Self-Attention) era todo lo necesario para obtener resultados de vanguardia.

En este artículo, desglosamos paso a paso cómo funciona el Transformer utilizando un ejemplo sencillo en español, infografías visuales y explicaciones claras sin fórmulas complejas.

Lo que había antes: El cuello de botella secuencial

Antes de la llegada de los Transformers, los modelos de traducción y procesamiento de lenguaje utilizaban Redes Neuronales Recurrentes (RNN), LSTMs, GRUs y Redes Convolucionales (CNN).

Estas arquitecturas tradicionales padecían dos grandes problemas:

  1. Cálculo Secuencial: Una red recurrente debe procesar la palabra 1 antes de pasar a la palabra 2, y la palabra 2 antes de la palabra 3. Esto impedía aprovechar la paralelización masiva de las GPUs durante el entrenamiento.
  2. Pérdida de Memoria a Larga Distancia: Conectar información entre dos palabras muy alejadas dentro de una oración larga requería atravesar muchos pasos intermedios, dificultando que el modelo aprendiera dependencias lejanas.

El Transformer resolvió ambos problemas conectando cada palabra con todas las demás en un camino de longitud constante, permitiendo que las GPUs procesaran oraciones enteras de forma simultánea.

Paso 1: Embeddings de Entrada y Codificación Posicional Sinusoidal

Las computadoras no procesan palabras directamente; procesan vectores de números.

  1. Embeddings de Entrada: Las palabras se convierten primero en vectores numéricos continuos de 512 dimensiones.
  2. Codificación Posicional (Positional Encoding): Dado que el Transformer lee todas las palabras al mismo tiempo, no tiene un sentido natural del orden del texto. Para solucionarlo, los autores sumaron funciones sinusoidales (ondas de seno y coseno de distintas frecuencias) directamente a los embeddings. Esto le añade un sello de posición único a cada palabra sin alterar su significado intrínseco.

Paso 2: La pila del Codificador / Encoder (6 Capas)

El Encoder se encarga de comprender a fondo la oración de entrada. Está compuesto por una torre de 6 capas idénticas.

La Atención Multicabezal en Acción

En una capa de Atención Multicabezal con 8 cabezales en paralelo, el modelo analiza la oración a través de múltiples subespacios de representación al mismo tiempo.

Consideremos nuestra frase de ejemplo:

"El banco está al lado del banco donde guardo mi dinero, pero me senté en el banco del parque a pensar"

¿Cómo sabe el modelo qué "banco" se refiere a una institución financiera y cuál a un asiento de madera?

  • Cabezal 1 se enfoca en el contexto financiero, conectando la palabra "banco" con "dinero" y "guardo".
  • Cabezal 2 se enfoca en la acción física, conectando la palabra "banco" con "senté" y "parque".

Al calcular las puntuaciones de atención entre cada par de palabras, el Encoder genera una representación vectorial rica y contextualizada para cada término.

Cada capa pasa luego por una Red Feed-Forward conectada por posición, rodeada de conexiones residuales y normalización de capa. La salida final de la sexta capa es una matriz de memoria fija contextualizada que contiene la comprensión completa de toda la frase.

Attention Is All You Need - Encoder Deep Dive

Infografía detallada del Encoder de 6 capas procesando la frase de ejemplo, resolviendo la ambigüedad del término "banco" mediante Atención Multicabezal y generando la matriz de memoria fija

Paso 3: La pila del Decodificador / Decoder (6 Capas) y el Bucle Autorregresivo

El Decoder genera la secuencia de salida palabra por palabra en un bucle autorregresivo. También consta de 6 capas idénticas.

1. Atención con Máscara (Masked Multi-Head Attention)

Al generar las palabras traducidas o de salida, el Decodificador no debe "hacer trampa" mirando palabras futuras. La máscara causal oculta las posiciones futuras antes de calcular las probabilidades, garantizando que cada posición solo atienda a las palabras ya generadas en el pasado.

2. Atención Cruzada Codificador-Decodificador

En esta subcapa, las Consultas (Queries) provienen de la capa previa del Decodificador, mientras que las Claves (Keys) y Valores (Values) provienen directamente de la matriz de memoria fija generada por el Encoder. Esto permite que el Decodificador consulte el contexto original de la frase cada vez que genera una nueva palabra.

3. Proyección Lineal y Softmax

Finalmente, la capa Lineal proyecta el vector resultante al tamaño completo del vocabulario. La función Softmaxconvierte los puntajes en porcentajes de probabilidad, seleccionando la palabra más probable. Esa palabra se realimenta al Decodificador para iniciar el siguiente ciclo.

The Transformer Decoder - Autoregressive Generation

Infografía explicativa sobre el funcionamiento del Decoder de 6 capas, la atención con máscara causal, la atención cruzada y el bucle de realimentación token por token

Recursos Prácticos y Lecturas Adicionales

Si deseas profundizar en el código o probar el Transformer en tu servidor local:

Preguntas Frecuentes (FAQ)

1. ¿Qué significa realmente "Attention Is All You Need"?

Significa que las tareas complejas de procesamiento de lenguaje (como la traducción automática) se pueden resolver utilizando únicamente mecanismos de atención, descartando por completo las redes neuronales recurrentes (RNN) y las capas convolucionales (CNN).

2. ¿Por qué el Transformer original utiliza 6 capas en el Encoder y en el Decoder?

La elección de 6 capas en ambos bloques fue una decisión empírica de diseño tomada por los autores para balancear la capacidad del modelo, la precisión en la traducción y el hardware disponible en ese momento (8 GPUs NVIDIA P100). Los grandes modelos actuales escalan esta cantidad a 32, 80 o más capas.

3. ¿Cómo funciona la Codificación Posicional sin recurrencia?

Como el Transformer lee todas las palabras al mismo tiempo, la codificación posicional suma valores sinusoidales fijos (funciones seno y coseno) a los embeddings de entrada. Esto le permite al modelo aprender las posiciones relativas de las palabras sin necesidad de una lectura secuencial paso a paso.

4. ¿Cuál es la diferencia entre Autoatención y Atención Cruzada?

  • Autoatención (Self-Attention): Relaciona palabras dentro de la misma secuencia (por ejemplo, palabras del Encoder atendiendo a otras palabras del Encoder).
  • Atención Cruzada (Cross-Attention): Permite que el Decodificador consulte la matriz de memoria del Encoder, conectando las palabras en generación con la oración original.

5. ¿Por qué el Decodificador necesita una Máscara Causal?

Durante el entrenamiento y la generación, la máscara causal evita que el Decodificador consulte palabras futuras. Al ocultar las posiciones siguientes, preserva la propiedad autorregresiva (prediciendo la siguiente palabra basándose únicamente en el contexto pasado).

6. ¿Cómo dio origen el Transformer a modelos modernos como GPT-4 o Llama?

La arquitectura Transformer demostró que los modelos de lenguaje podían escalarse masivamente mediante el procesamiento en paralelo en GPUs. Los modelos de la familia GPT utilizan la pila del Decodificador (decoder-only Transformers) para la generación autorregresiva de texto, mientras que modelos como BERT utilizan el Encoder (encoder-only Transformers) para la comprensión bidireccional profunda.


Jair Manuel Poveda Frago

Jair Manuel Poveda Frago

Python & Django Engineer

Desarrollador Python y Django, fundador de Cooltimedia y profesor universitario. Especialista en arquitectura de software, IA y soluciones de datos. Conecto la ingeniería aplicada en proyectos reales con la docencia universitaria, compartiendo aprendizajes sobre desarrollo profesional, automatización y buenas prácticas de ingeniería.