Qué ocurre dentro de un LLM cuando escribes “hello” guía paso a paso cómo el modelo transforma una palabra en tokens, calcula embeddings vectoriales, aplica mecanismos de atención y estima distribuciones de probabilidad sobre siguientes tokens. El texto describe cómo esas probabilidades determinan la selección de palabras y cómo las capas sucesivas refinan la representación hasta producir la respuesta final, manteniendo principios básicos sin entrar en implementaciones propietarias. Este enfoque didáctico ayuda a comprender por qué pequeños cambios en la entrada o en el muestreo alteran el resultado del modelo.
Tu texto se convierte en tokens. Esos tokens se convierten en representaciones numéricas. Las capas transformadoras los procesan. La atención ayuda al modelo a incorporar relaciones contextuales. El modelo calcula las probabilidades de posibles próximos tokens. Un proceso de generación selecciona tokens uno tras otro. Y eventualmente, esos tokens se convierten en la oración que ves en tu pantalla.