La IA en Castellano, Únete al Rebaño

Usamos inteligencia artificial todos los días, pero entender qué sucede dentro sigue siendo otra historia. En La Maquinaria de la IA, primera entrega de la serie especial De la neurona a la singularidad, abrimos el capó de los grandes modelos de IA para explicar su funcionamiento de forma técnica, comprensible y sin exigir un doctorado previo ni sacrificar una tarde leyendo documentación.

Empezamos por lo fundamental: qué diferencia hay entre inteligencia artificial, machine learning y deep learning. Después seguimos el recorrido de una pregunta desde que entra en un modelo hasta que obtenemos una respuesta: tokens, números, embeddings, vectores y redes neuronales. El mundo humano termina convertido en matemáticas. Qué detalle tan romántico.

Explicamos después cómo aprende una red neuronal mediante predicciones, errores y correcciones: propagación hacia delante, función de pérdida, retropropagación, optimización, batch, épocas, validación, sobreajuste, checkpoints y generalización. El entrenamiento de una IA consiste, básicamente, en equivocarse industrialmente hasta empezar a equivocarse bastante menos.

Llegamos también al Transformer, la arquitectura que puso la atención en el centro del procesamiento del contexto, y a una de las grandes paradojas de la IA moderna: una infraestructura gigantesca entrenada originalmente para hacer algo aparentemente tan sencillo como predecir el siguiente token.

Pero un modelo base no es todavía un asistente. Analizamos el ajuste supervisado, RLHF, DPO, RLAIF y la diferencia entre supervisar el proceso y supervisar únicamente el resultado. Después salimos de los parámetros del modelo para entender RAG, herramientas y agentes, sistemas capaces no solo de generar texto, sino también de consultar información externa, ejecutar acciones y operar sobre el mundo real.

Finalmente entramos en la frontera técnica: mezcla de expertos, datos sintéticos, multimodalidad, interpretabilidad mecanicista, cuantización, destilación, aprendizaje en contexto, prompts, alucinaciones y modelos del mundo. Y cerramos desmontando algunos mitos: ni cada parámetro guarda un dato, ni la ventana de contexto es memoria permanente, ni RAG reentrena el modelo, ni más parámetros garantizan automáticamente una IA mejor.

La Maquinaria de la IA no pretende convertir al oyente en ingeniero de machine learning. Pretende algo quizá más peligroso: que cuando vuelva a utilizar una IA entienda un poco mejor qué tiene delante.

Porque detrás de la aparente genialidad no hay magia. Hay datos, representaciones matemáticas, entrenamiento, postentrenamiento, herramientas y una enorme ingeniería de sistemas.

Y, de vez en cuando, una estupidez de nivel infantil treinta segundos después. La tecnología punta también tiene sus tradiciones.

¿Cómo funciona una inteligencia artificial generativa?

Un modelo de IA transforma la entrada en representaciones numéricas, procesa sus relaciones mediante una red neuronal y genera una respuesta prediciendo sucesivamente tokens. El entrenamiento ajusta sus parámetros reduciendo errores; el postentrenamiento adapta su comportamiento a instrucciones y preferencias; y tecnologías como RAG, herramientas y agentes permiten incorporar información externa y ejecutar acciones.

Conceptos tratados: inteligencia artificial, machine learning, deep learning, tokens, embeddings, vectores, redes neuronales, entrenamiento, retropropagación, función de pérdida, Transformer, atención, modelos autorregresivos, preentrenamiento, RLHF, DPO, RLAIF, RAG, agentes de IA, mixture of experts, datos sintéticos, multimodalidad, interpretabilidad, cuantización, destilación, prompting y alucinaciones.

Capítulos de Referencia:

La naturaleza de la IA

Luz sobre la IA

GPT te explica la IA

Table of Contents