HUMANía
Yann LeCun y Meta: Explorando Nuevas Fronteras en IA
Escuchar este episodio
Abre el episodio completo en iVoox.
Descubre cómo Meta, liderada por el legendario Yann LeCun, está transformando el panorama de la inteligencia artificial con sus innovadores modelos I-JEPA y V-JEPA. Desde entender el mundo visual de manera más humana hasta acercarse a la predicción del futuro, estas tecnologías marcan un antes y un después en el desarrollo de la IA. ¿Estamos a las puertas de una Inteligencia Artificial General o solo es una ilusión? Acompáñanos en este fascinante viaje.
Puntos clave:
- Quién es Yann LeCun y su impacto en la IA: El hombre detrás de las redes neuronales convolucionales y el cerebro detrás de Meta AI.
- I-JEPA: Revolucionando el reconocimiento de imágenes: Con su enfoque en la comprensión abstracta, I-JEPA aprende más rápido y con menos datos que sus predecesores.
- V-JEPA: El salto del 2D al video: Con un método de predicción en espacios abstractos, V-JEPA promete cambiar cómo entendemos y utilizamos los videos en la IA.
- Las implicaciones de estas tecnologías: Desde vehículos autónomos hasta diagnósticos médicos y seguridad pública, el potencial es vasto.
- LeCun y su visión del futuro de la IA: Olvida la AGI por ahora; el enfoque está en una inteligencia artificial avanzada y más alcanzable.
- ¿Estamos realmente cerca de una IA que prediga el futuro o es solo ciencia ficción?
Transcripción
Muestra de la transcripción del episodio. Puedes desplegarla completa si prefieres leerlo.
((Muy buenos días amigo, feliz sábado, espero que sea de 10. Un día mas repasamos la musiquita de la semana en tu podcast AI IA HOY. Y de paso escuchamos lo que nos cuenta Aiberto de su admirado LeCum y del modelo de IA con el que trabaja Meta. Gracias por suscribirte, nos está ayudando…
Leer la transcripción completa
((Muy buenos días amigo, feliz sábado, espero que sea de 10. Un día mas repasamos la musiquita de la semana en tu podcast AI IA HOY. Y de paso escuchamos lo que nos cuenta Aiberto de su admirado LeCum y del modelo de IA con el que trabaja Meta.
Gracias por suscribirte, nos está ayudando mucho, vamos a bailar.))
En Junio del año pasado, Meta (La empresa de Zuckerberg, vamos Facebook,
Instagram, Whatsapp, etc.) lanza I-JEPA, con Yann LeCun a la cabeza.
Ya lo hemos comentado, LeCun es un mito en el mundo de la IA.
Conocido especialmente por sus contribuciones al desarrollo de las redes neuronales
convolucionales (CNN, por sus siglas en inglés) y su trabajo en aprendizaje profundo.
Nacido en Francia en 1960, LeCun ha jugado un papel crucial en la evolución de la IA
desde la década de los 80.
(((Su educación en ingeniería eléctrica y ciencias de la computación en la École Supérieure d'Ingénieurs en Électrotechnique et Électronique (ESIEE) en París y su posterior doctorado en ciencias de la computación en la Université Pierre et Marie Curie, lo equiparon con una sólida base para su futura investigación. Su tesis doctoral, que se centró en modelos de redes neuronales para el reconocimiento de patrones, sentó las bases de su futura carrera.
Uno de los logros más significativos de LeCun fue el desarrollo de la red neuronal convolucional LeNet en los años 80, mientras trabajaba en AT&T Bell Labs. LeNet fue diseñada para el reconocimiento de dígitos manuscritos y fue una de las primeras aplicaciones prácticas del aprendizaje profundo. Este trabajo no solo fue pionero en el campo del reconocimiento de imágenes, sino que también demostró la eficacia de las CNN en tareas de visión por computadora, una técnica que más tarde se expandiría a innumerables aplicaciones.)))
En 2013, LeCun cofundó el laboratorio de investigación en inteligencia artificial FAIR
(Facebook AI Research) en Facebook (ahora Meta), donde se desempeña como Jefe de IA.
Su liderazgo en FAIR ha contribuido a importantes avances en IA, desde el mejoramiento
de los sistemas de reconocimiento de imágenes hasta el desarrollo de algoritmos
que pueden predecir y planificar acciones futuras.
Además de su trabajo en Meta, LeCun es profesor en la Universidad de Nueva York,
donde su investigación se centra en el aprendizaje estadístico, las redes neuronales y la robótica.
Ha sido galardonado con numerosos premios, incluyendo el premio Turing, el "Nobel de la
Computación", que recibió en 2018 junto con Geoffrey Hinton y Yoshua Bengio por su trabajo
en el desarrollo de redes neuronales profundas.
LeCun sigue siendo una figura central en la investigación y desarrollo de la inteligencia artificial,
impulsando la innovación hacia sistemas de IA más avanzados y autónomos.
Su visión continua hacia una IA más general que pueda aprender de la manera en que los
humanos lo hacen, promete seguir moldeando el futuro de la tecnología.
I-JEPA, que significa Arquitectura Predictiva de Inmersión Conjunta de Imágenes, es un modelo
de IA diseñado para aprender de manera más natural y eficiente. Tradicionalmente,
los modelos de visión por computadora analizan y comparan píxeles directamente.
I-JEPA cambia esto al crear y comparar representaciones abstractas de imágenes,
lo que le permite entender mejor el contexto y las relaciones en los datos visuales.
¿Gipiti, Cómo se beneficia I-JEPA de este enfoque?
(((Utilizando este método, I-JEPA puede aprender mucho más rápido y adaptarse a nuevas tareas con menos datos. Por ejemplo, en pruebas, hemos logrado entrenar un modelo transformador visual de 632 millones de parámetros en menos de 72 horas utilizando 16 GPUs, obteniendo resultados de vanguardia en tareas como la clasificación de imágenes con muy pocos ejemplos por clase.)))
Que es eso de "arquitectura predictiva de inmersión conjunta".
Imagina que I-JEPA ve una imagen parcialmente oculta. En lugar de concentrarse solo en los píxeles
visibles, intenta predecir las partes ocultas basándose en su entendimiento del mundo visual.
Lo hace prediciendo las representaciones de las partes ocultas a partir de las partes visibles.
Este enfoque difiere significativamente de otros métodos que intentan reconstruir directamente
los detalles a nivel de píxel, lo que a menudo resulta en errores cuando el modelo
enfrenta escenarios impredecibles (es decir, para los que no está entrenado).
Pon algún ejemplo específico de cómo I-JEPA aplica este método Gipiti.
(((Claro, en un experimento, I-JEPA fue expuesto a imágenes de animales donde partes significativas como las cabezas estaban ocultas. El modelo utilizó el contexto visible, como el cuerpo del animal, para predecir la apariencia de la cabeza cubierta. Y lo interesante es que no solo predecía los detalles generales, sino que también capturaba características específicas como la expresión facial basada en la postura y el contexto del cuerpo.)))
Joe…
Las aplicaciones de esto pueden ser la hostia...
Desde mejorar los sistemas avanzados de asistencia al conductor en vehículos autónomos
hasta sistemas de vigilancia que pueden entender y reaccionar a situaciones complejas en
tiempo real. Además, en el ámbito de la salud, podría ayudar en diagnósticos médicos automáticos,
donde la capacidad de interpretar imágenes médicas de manera eficiente es crucial.
El mes pasado Meta y Yann LeCun presentan V-JEPA pasando de las fotos…
al video, por lo tanto, el siguiente paso son las tres dimensiones y por
último, el mundo real… igual ni necesitan pasar por el 3D.
V-JEPA, que significa, Arquitectura Predictiva de Inmersión Conjunta para Video,
es un modelo de IA que aprende de videos de manera no generativa. En lugar de intentar
rellenar cada píxel faltante en un video, como hacen los modelos generativos, V-JEPA predice
partes faltantes o enmascaradas de un video en un espacio de representación abstracto.
Esto le permite ser más eficiente y adaptativo, ignorando información impredecible
que no es crucial para entender el contenido general del video.
Gipiti, como Funciona V-JEPA?
(((Funciona de una forma similar al anterior modelo, mediante el enmascaramiento de grandes partes de un video, dejando visible solo un pequeño contexto. Luego, se le pide al predictor que llene los espacios en blanco, no en términos de píxeles reales, sino como una descripción abstracta en este espacio de representación. Esto se hace pre-entrenando completamente el modelo con datos no etiquetados, lo que lo hace muy eficiente tanto en términos de aprendizaje como en el uso posterior de los datos.)))
Al aprender de esta manera, V-JEPA no solo mejora la eficiencia en el entrenamiento
sino también en el rendimiento con pocos datos etiquetados. Por ejemplo, en las pruebas,
superó a otros modelos en tareas como la clasificación de acciones y detección
de interacciones objeto-objeto en videos, todo mientras utiliza significativamente
menos datos etiquetados.
Esto significa que está aprendiendo el mundo como un niño…
Por si mismo y experimentando…
Debido a que adopta un enfoque de aprendizaje auto-supervisado,
V-JEPA se pre-entrena completamente con datos no etiquetados.
Las etiquetas solo se utilizan para adaptar el modelo a una tarea particular después
del pre-entrenamiento. Este tipo de arquitectura resulta más eficiente que los modelos anteriores,
tanto en términos del número de ejemplos etiquetados necesarios como del esfuerzo
total invertido en aprender incluso los datos no etiquetados.
Con V-JEPA, han conseguido aumentos de eficiencia en ambos frentes.
(((Enmascaramos una gran parte de un video, por lo que el modelo solo muestra un poco del contexto. Luego, le pedimos al predictor que rellene los espacios en blanco de lo que falta, no en términos de los píxeles reales, sino más bien como una descripción más abstracta en este espacio de representación. V-JEPA entrena un codificador visual prediciendo regiones espaciotemporales enmascaradas en un espacio latente aprendido.)))
V-JEPA no fue entrenado para entender un tipo específico de acción. En cambio,
utilizó el entrenamiento auto-supervisado en una variedad de videos y aprendió varias cosas
sobre cómo funciona el mundo. El equipo también consideró cuidadosamente la estrategia
de enmascaramiento: si no bloqueas grandes regiones del video y, en cambio, tomas
muestras aleatorias de parches aquí y allá, hace que la tarea sea demasiado fácil y tu modelo
no aprende nada particularmente complicado sobre el mundo. Dicen los ingenieros de Meta.
También es importante señalar que, en la mayoría de los videos, las cosas evolucionan algo
lentamente con el tiempo. Si enmascaras una parte del video pero solo por un instante
específico en el tiempo y el modelo puede ver lo que ocurrió inmediatamente antes y/o después,
también hace que las cosas sean demasiado fáciles y el modelo casi seguro no aprenderá
nada interesante. Por eso, el equipo utilizó un enfoque donde enmascaró partes del video tanto
en el espacio como en el tiempo, lo que obliga al modelo a aprender y
desarrollar una comprensión de la escena.
Hacer estas predicciones en el espacio de representación abstracta es importante porque
permite que el modelo se concentre en la información conceptual de alto nivel de lo
que contiene el video sin preocuparse por el tipo de detalles que son a menudo irrelevantes
para las tareas posteriores. Después de todo, si un video muestra un árbol, es probable
que no te preocupes por los movimientos minuciosos de cada hoja individual.
(((Una de las razones por las que estamos emocionados con esta dirección es que V-JEPA es el primer modelo para video que es bueno en "evaluaciones congeladas", lo que significa que hacemos todo nuestro pre-entrenamiento auto-supervisado en el codificador y el predictor, y luego no tocamos esas partes del modelo nunca más. Cuando queremos adaptarlos para aprender una nueva habilidad, simplemente entrenamos una capa especializada ligera o una pequeña red encima de eso, lo cual es muy eficiente y rápido.)))
Las aplicaciones de V-JEPA son increíbles y pueden abarcar desde la seguridad pública,
con sistemas de vigilancia más inteligentes, hasta el entretenimiento, mejorando la forma
en que se editan y se generan contenidos de video automáticos. V-JEPA tiene
un gran potencial en el campo de la robótica, donde podría ayudar a los robots a
entender mejor su entorno visual y temporal.
Además están explorando cómo V-JEPA puede incorporar otros modos, como audio,
para enriquecer su comprensión del contenido de los videos.
También están investigando cómo puede utilizarse para predecir eventos futuros en videos
más largos, lo cual podría tener implicaciones significativas para la planificación
y toma de decisiones en IA.
La IA ya predice texto, audio, video, cuando nos vamos a morir…
Si comprende el contexto, esto os va a sorprender, estaría preparada
para predecir el futuro…
Esto empieza a sonar a AGI…
No preocuparse, según LeCun, eso es una quimera, por ahora.
Cree que el aprendizaje automático es una mierda y que deberíamos pensar en metas más cortas.
Propone un enfoque hacia una Inteligencia Artificial Avanzada (AMI) en lugar de la AGI.
LeCun criticó fuertemente la eficacia de la IA generativa y promovió el uso de
Arquitecturas de Incrustación Conjunta (JEPA). Según LeCun, los modelos como V-JEPA e I-JEPA,
desarrollados por Meta, son capaces de entender y predecir el mundo físico de manera más
efectiva que los modelos generativos. Estos sistemas pueden operar con menos supervisión
y son capaces de aprender observando pasivamente, similar a cómo lo haría un nen.
LeCun sostiene que para que la IA alcance un nivel de inteligencia comparable al humano,
necesita poder recordar, razonar y planificar, no solo generar texto.
Criticó la idea de que la inteligencia artificial en su forma actual pueda ser considerada
"inteligente", destacando que incluso los sistemas avanzados como los vehículos
autónomos todavía están lejos de operar sin intervención humana.
Se refiere a que una IA no puede comprender el mundo y conducir en consecuencia,
son programas que unidos realizan la tarea…
pero en San Francisco, puedes desde ir de un lado a otro sin problema
y sin conductor hasta apedrear y quemar un coche autónomo si se queda bloqueado.
El científico comparó la capacidad de aprendizaje de un niño con los modelos de lenguaje
grandes (LLMs), señalando que los niños adquieren conocimiento a través de la experiencia
directa mucho más que mediante el lenguaje. Además, argumentó que la inteligencia humana
es difícil de cuantificar y generalizar, ya que es altamente especializada y no lineal.
LeCun visualiza un futuro donde cada interacción digital estará mediada por asistentes de IA,
operando a través de dispositivos como las gafas inteligentes. Este futuro, sin embargo,
requiere que la IA pueda comprender y interactuar con una amplia gama de culturas,
idiomas y necesidades individuales.
Finalmente, LeCun enfatizó la importancia de un enfoque colaborativo y abierto hacia
el desarrollo de la IA. Propone que el conocimiento necesario para avanzar en la IA no
puede ser monopolizado por unas pocas empresas y debe ser accesible
como lo es Internet o Wikipedia.
LeCun reafirma que, aunque el desarrollo de una inteligencia a nivel humano está lejos,
es inevitable. Critica las visiones alarmistas sobre la IA, sugiriendo que, en lugar de temer,
deberíamos trabajar hacia una integración responsable de la IA en la sociedad.
((Gracias por pararte a escuchar. En un rato, resumimos la semana IA, las 6 cositas que tienes que saber de la actualidad, comparte el episodio, comenta, y por supuesto…
Vuelva usted mañana.))