26 de septiembre de 2026

Cuando la máquina aprendió a prestar atención

0
TEC

Cuando escribes en el celular y el teclado “adivina” la siguiente palabra, o si un asistente resume un chat largo sin perder el hilo, está usando una idea publicada en 2017 con un título casi provocador: Attention Is All You Need (“La atención es todo lo que necesitas”).

Ese trabajo, firmado por Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser e Illia Polosukhin, se presentó en NeurIPS 2017 (preprint arXiv:1706.03762). No hablaba de robots conscientes. Hablaba de traducción automática. Y cambió el piso de casi toda la inteligencia artificial de lenguaje que hoy llega a Maturín en un bolsillo.

El problema de antes: la máquina leía como quien hace fila

Hasta entonces, los modelos más fuertes para traducir o generar texto solían apoyarse en redes recurrentes: procesaban la frase palabra por palabra, en orden, como quien no puede colearse en la fila del banco. Era lento de entrenar y se le complicaba mantener el hilo cuando la relación importante estaba lejos, hablamos de distancia en número de letras o de palabras.

Había otro camino: convoluciones. Y los mejores sistemas ya usaban “atención”… casi siempre junto a la recurrencia, sin reemplazarla.

La apuesta: tirar la fila y quedarse con la atención

El equipo propuso el Transformer, una arquitectura basada solo en atención. En el abstract lo dicen así:

“We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.”

En criollo: la máquina ya no está obligada a avanzar palabra por palabra. Puede mirar, de golpe, qué partes del mensaje se relacionan, como cuando miras WhatsApp y saltas del saludo al insulto que importa.

Esa mirada es la self-attention (autoatención). El paper la define así:

“Self-attention, sometimes called intra-attention is an attention mechanism relating different positions of a single sequence in order to compute a representation of the sequence.”

Cada trozo de texto consulta al resto y decide a qué ponerle más peso. ¿El “la” de “la lluvia”? eso es una pluma. ¿El “no” de “no llegues”? es un mandarriazo.

En la introducción refuerzan el salto conceptual:

“In this work we propose the Transformer, a model architecture eschewing recurrence and instead relying entirely on an attention mechanism to draw global dependencies between input and output.”

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *