Principio
El texto se divide en tokens y vectores. La atención relaciona palabras y la temperatura regula la variación de la respuesta. Los documentos se buscan por cercanía entre embeddings.
La siguiente palabra (modelo real)
Experimento 2Cerca de 0: siempre la palabra más probable. Alta: el modelo se arriesga.
De frase a tokens
Experimento 1Caracteres
48
Tokens
9
Caracteres por token
5.3
Cada bloque es un token con su número de identificación. El modelo nunca ve letras: ve esta lista de números. (Partición didáctica, cercana a la de un modelo real.)
¿A qué presta atención?
Experimento 3Toca una palabra: se iluminan las palabras a las que presta atención para entenderse.
Matriz de atención: cada fila es una palabra mirando hacia atrás.