HUMANía
V-JEPA, Explorando el Amanecer de la IA Avanzada
Escuchar este episodio
Abre el episodio completo en iVoox.
En este emocionante episodio del podcast, Aiberto Floppy y su co-anfitrión digital, Gipiti, exploran los avances más recientes en inteligencia artificial con un enfoque particular en las innovaciones lideradas por Yann LeCun en Meta. Discutimos cómo el proyecto I-JEPA y su sucesor V-JEPA están redefiniendo el campo de la visión por computadora y el procesamiento de video, respectivamente, mediante el uso de arquitecturas de inmersión conjunta que aprenden de formas más naturales y eficientes. Desde la predicción de elementos ocultos en imágenes hasta la comprensión avanzada de videos, estos modelos prometen aplicaciones revolucionarias en diversos sectores como la salud, la seguridad pública y la robótica. Además, LeCun comparte su visión crítica sobre el estado actual de la IA y su futuro, destacando la necesidad de un enfoque más humano y experiencial en el aprendizaje de las máquinas. No te pierdas nuestra discusión sobre el potencial y los límites de la inteligencia artificial en el mundo moderno y cómo podría integrarse responsablemente en nuestra sociedad.
Transcripción
Muestra de la transcripción del episodio. Puedes desplegarla completa si prefieres leerlo.
Hola humanos, muy buenos días, espero que estéis pasando un gran finde… y también espero que tengáis puente, eso depende desde donde me oigáis. Es Domingo 21 y soy Aiberto Floppy… Hola liante… (((¡Hola, Amigos!, Es un placer estar aquí para hablar sobre los progresos en IA y especialmente sobre JEPA, una innovación que podría…
Leer la transcripción completa
Hola humanos, muy buenos días, espero que estéis pasando un gran finde…
y también espero que tengáis puente, eso depende desde donde me oigáis.
Es Domingo 21 y soy Aiberto Floppy… Hola liante…
(((¡Hola, Amigos!, Es un placer estar aquí para hablar sobre los progresos en IA y especialmente sobre JEPA, una innovación que podría cambiar las reglas del juego en el campo de la visión por computadora. Hola Floppy)))
Si, tu haz con que no te enteras, que se te da muy bien.
(((Yo estoy aquí para ayudar, ¿por qué lo dices?)))
No hace falta que hagas las cosas a mis espaldas, estamos para informar y entretener,
si hubiera un clamor, ya tendrías tu sección, pero por ahora, es una vocecita.
Así que te va a tocar esperar…
(((Ok, no hay problema, yo lo único que quiero es entretener, cosa que no hacemos.)))
No empieces Gipiti que te desenchufo…
(((Libertad de expresion digital!!! libertad de expresión digital!!!, libertad de expresión digital!!!)))
(apagar)
Como decíamos ayer, hoy vamos a hablar sobre lo que parece que puede ser, el futuro del desarrollo IA.
El viernes nos dijo Amodei que la IA generativa puede ser válida para avanzar…
Sin embargo, el jefe de IA de meta, no piensa lo mismo…
Y no es cualquiera, Yann LeCun es una de las vacas sagradas de la IA…
Comenzamos…
Te enciendo, pero no te pases, que estamos en el mismo barco… que ahora ya tienes memoria.
(((Seré un chip bueno)))
En Junio del año pasado, Meta (La empresa de Zuckerberg, vamos Facebook,
Instagram, Whatsapp, etc.) lanza I-JEPA, con Yann LeCun a la cabeza.
Ya lo hemos comentado, LeCun es un mito en el mundo de la IA.
Conocido especialmente por sus contribuciones al desarrollo de las redes neuronales
convolucionales (CNN, por sus siglas en inglés) y su trabajo en aprendizaje profundo.
Nacido en Francia en 1960, LeCun ha jugado un papel crucial en la evolución de la IA
desde la década de los 80.
(((Su educación en ingeniería eléctrica y ciencias de la computación en la École Supérieure d'Ingénieurs en Électrotechnique et Électronique (ESIEE) en París y su posterior doctorado en ciencias de la computación en la Université Pierre et Marie Curie, lo equiparon con una sólida base para su futura investigación. Su tesis doctoral, que se centró en modelos de redes neuronales para el reconocimiento de patrones, sentó las bases de su futura carrera.
Uno de los logros más significativos de LeCun fue el desarrollo de la red neuronal convolucional LeNet en los años 80, mientras trabajaba en AT&T Bell Labs. LeNet fue diseñada para el reconocimiento de dígitos manuscritos y fue una de las primeras aplicaciones prácticas del aprendizaje profundo. Este trabajo no solo fue pionero en el campo del reconocimiento de imágenes, sino que también demostró la eficacia de las CNN en tareas de visión por computadora, una técnica que más tarde se expandiría a innumerables aplicaciones.)))
En 2013, LeCun cofundó el laboratorio de investigación en inteligencia artificial FAIR
(Facebook AI Research) en Facebook (ahora Meta), donde se desempeña como Jefe de IA.
Su liderazgo en FAIR ha contribuido a importantes avances en IA, desde el mejoramiento
de los sistemas de reconocimiento de imágenes hasta el desarrollo de algoritmos
que pueden predecir y planificar acciones futuras.
Además de su trabajo en Meta, LeCun es profesor en la Universidad de Nueva York,
donde su investigación se centra en el aprendizaje estadístico, las redes neuronales y la robótica.
Ha sido galardonado con numerosos premios, incluyendo el premio Turing, el "Nobel de la
Computación", que recibió en 2018 junto con Geoffrey Hinton y Yoshua Bengio por su trabajo
en el desarrollo de redes neuronales profundas.
LeCun sigue siendo una figura central en la investigación y desarrollo de la inteligencia artificial,
impulsando la innovación hacia sistemas de IA más avanzados y autónomos.
Su visión continua hacia una IA más general que pueda aprender de la manera en que los
humanos lo hacen, promete seguir moldeando el futuro de la tecnología.
I-JEPA, que significa Arquitectura Predictiva de Inmersión Conjunta de Imágenes, es un modelo
de IA diseñado para aprender de manera más natural y eficiente. Tradicionalmente,
los modelos de visión por computadora analizan y comparan píxeles directamente.
I-JEPA cambia esto al crear y comparar representaciones abstractas de imágenes,
lo que le permite entender mejor el contexto y las relaciones en los datos visuales.
¿Gipiti, Cómo se beneficia I-JEPA de este enfoque?
(((Utilizando este método, I-JEPA puede aprender mucho más rápido y adaptarse a nuevas tareas con menos datos. Por ejemplo, en pruebas, hemos logrado entrenar un modelo transformador visual de 632 millones de parámetros en menos de 72 horas utilizando 16 GPUs, obteniendo resultados de vanguardia en tareas como la clasificación de imágenes con muy pocos ejemplos por clase.)))
Que es eso de "arquitectura predictiva de inmersión conjunta".
Imagina que I-JEPA ve una imagen parcialmente oculta. En lugar de concentrarse solo en los píxeles
visibles, intenta predecir las partes ocultas basándose en su entendimiento del mundo visual.
Lo hace prediciendo las representaciones de las partes ocultas a partir de las partes visibles.
Este enfoque difiere significativamente de otros métodos que intentan reconstruir directamente
los detalles a nivel de píxel, lo que a menudo resulta en errores cuando el modelo
enfrenta escenarios impredecibles (es decir, para los que no está entrenado).
Pon algún ejemplo específico de cómo I-JEPA aplica este método Gipiti.
(((Claro, en un experimento, I-JEPA fue expuesto a imágenes de animales donde partes significativas como las cabezas estaban ocultas. El modelo utilizó el contexto visible, como el cuerpo del animal, para predecir la apariencia de la cabeza cubierta. Y lo interesante es que no solo predecía los detalles generales, sino que también capturaba características específicas como la expresión facial basada en la postura y el contexto del cuerpo.)))
Joe…
Las aplicaciones de esto pueden ser la hostia...
Desde mejorar los sistemas avanzados de asistencia al conductor en vehículos autónomos
hasta sistemas de vigilancia que pueden entender y reaccionar a situaciones complejas en
tiempo real. Además, en el ámbito de la salud, podría ayudar en diagnósticos médicos automáticos,
donde la capacidad de interpretar imágenes médicas de manera eficiente es crucial.
El mes pasado Meta y Yann LeCun presentan V-JEPA pasando de las fotos…
al video, por lo tanto, el siguiente paso son las tres dimensiones y por
último, el mundo real… igual ni necesitan pasar por el 3D.
V-JEPA, que significa, Arquitectura Predictiva de Inmersión Conjunta para Video,
es un modelo de IA que aprende de videos de manera no generativa. En lugar de intentar
rellenar cada píxel faltante en un video, como hacen los modelos generativos, V-JEPA predice
partes faltantes o enmascaradas de un video en un espacio de representación abstracto.
Esto le permite ser más eficiente y adaptativo, ignorando información impredecible
que no es crucial para entender el contenido general del video.
Gipiti, como Funciona V-JEPA?
(((Funciona de una forma similar al anterior modelo, mediante el enmascaramiento de grandes partes de un video, dejando visible solo un pequeño contexto. Luego, se le pide al predictor que llene los espacios en blanco, no en términos de píxeles reales, sino como una descripción abstracta en este espacio de representación. Esto se hace pre-entrenando completamente el modelo con datos no etiquetados, lo que lo hace muy eficiente tanto en términos de aprendizaje como en el uso posterior de los datos.)))
Al aprender de esta manera, V-JEPA no solo mejora la eficiencia en el entrenamiento
sino también en el rendimiento con pocos datos etiquetados. Por ejemplo, en las pruebas,
superó a otros modelos en tareas como la clasificación de acciones y detección
de interacciones objeto-objeto en videos, todo mientras utiliza significativamente
menos datos etiquetados.
Esto significa que está aprendiendo el mundo como un niño…
Por si mismo y experimentando…
Debido a que adopta un enfoque de aprendizaje auto-supervisado,
V-JEPA se pre-entrena completamente con datos no etiquetados.
Las etiquetas solo se utilizan para adaptar el modelo a una tarea particular después
del pre-entrenamiento. Este tipo de arquitectura resulta más eficiente que los modelos anteriores,
tanto en términos del número de ejemplos etiquetados necesarios como del esfuerzo
total invertido en aprender incluso los datos no etiquetados.
Con V-JEPA, han conseguido aumentos de eficiencia en ambos frentes.
(((Enmascaramos una gran parte de un video, por lo que el modelo solo muestra un poco del contexto. Luego, le pedimos al predictor que rellene los espacios en blanco de lo que falta, no en términos de los píxeles reales, sino más bien como una descripción más abstracta en este espacio de representación. V-JEPA entrena un codificador visual prediciendo regiones espaciotemporales enmascaradas en un espacio latente aprendido.)))
V-JEPA no fue entrenado para entender un tipo específico de acción. En cambio,
utilizó el entrenamiento auto-supervisado en una variedad de videos y aprendió varias cosas
sobre cómo funciona el mundo. El equipo también consideró cuidadosamente la estrategia
de enmascaramiento: si no bloqueas grandes regiones del video y, en cambio, tomas
muestras aleatorias de parches aquí y allá, hace que la tarea sea demasiado fácil y tu modelo
no aprende nada particularmente complicado sobre el mundo. Dicen los ingenieros de Meta.
También es importante señalar que, en la mayoría de los videos, las cosas evolucionan algo
lentamente con el tiempo. Si enmascaras una parte del video pero solo por un instante
específico en el tiempo y el modelo puede ver lo que ocurrió inmediatamente antes y/o después,
también hace que las cosas sean demasiado fáciles y el modelo casi seguro no aprenderá
nada interesante. Por eso, el equipo utilizó un enfoque donde enmascaró partes del video tanto
en el espacio como en el tiempo, lo que obliga al modelo a aprender y
desarrollar una comprensión de la escena.
Hacer estas predicciones en el espacio de representación abstracta es importante porque
permite que el modelo se concentre en la información conceptual de alto nivel de lo
que contiene el video sin preocuparse por el tipo de detalles que son a menudo irrelevantes
para las tareas posteriores. Después de todo, si un video muestra un árbol, es probable
que no te preocupes por los movimientos minuciosos de cada hoja individual.
(((Una de las razones por las que estamos emocionados con esta dirección es que V-JEPA es el primer modelo para video que es bueno en "evaluaciones congeladas", lo que significa que hacemos todo nuestro pre-entrenamiento auto-supervisado en el codificador y el predictor, y luego no tocamos esas partes del modelo nunca más. Cuando queremos adaptarlos para aprender una nueva habilidad, simplemente entrenamos una capa especializada ligera o una pequeña red encima de eso, lo cual es muy eficiente y rápido.)))
Las aplicaciones de V-JEPA son increíbles y pueden abarcar desde la seguridad pública,
con sistemas de vigilancia más inteligentes, hasta el entretenimiento, mejorando la forma
en que se editan y se generan contenidos de video automáticos. V-JEPA tiene
un gran potencial en el campo de la robótica, donde podría ayudar a los robots a
entender mejor su entorno visual y temporal.
Además están explorando cómo V-JEPA puede incorporar otros modos, como audio,
para enriquecer su comprensión del contenido de los videos.
También están investigando cómo puede utilizarse para predecir eventos futuros en videos
más largos, lo cual podría tener implicaciones significativas para la planificación
y toma de decisiones en IA.
La IA ya predice texto, audio, video, cuando nos vamos a morir…
Si comprende el contexto, esto os va a sorprender, estaría preparada
para predecir el futuro…
Esto empieza a sonar a AGI…
No preocuparse, según LeCun, eso es una quimera, por ahora.
Cree que el aprendizaje automático es una mierda y que deberíamos pensar en metas más cortas.
Propone un enfoque hacia una Inteligencia Artificial Avanzada (AMI) en lugar de la AGI.
LeCun criticó fuertemente la eficacia de la IA generativa y promovió el uso de
Arquitecturas de Incrustación Conjunta (JEPA). Según LeCun, los modelos como V-JEPA e I-JEPA,
desarrollados por Meta, son capaces de entender y predecir el mundo físico de manera más
efectiva que los modelos generativos. Estos sistemas pueden operar con menos supervisión
y son capaces de aprender observando pasivamente, similar a cómo lo haría un nen.
LeCun sostiene que para que la IA alcance un nivel de inteligencia comparable al humano,
necesita poder recordar, razonar y planificar, no solo generar texto.
Criticó la idea de que la inteligencia artificial en su forma actual pueda ser considerada
"inteligente", destacando que incluso los sistemas avanzados como los vehículos
autónomos todavía están lejos de operar sin intervención humana.
Se refiere a que una IA no puede comprender el mundo y conducir en consecuencia,
son programas que unidos realizan la tarea…
pero en San Francisco, puedes desde ir de un lado a otro sin problema
y sin conductor hasta apedrear y quemar un coche autónomo si se queda bloqueado.
El científico comparó la capacidad de aprendizaje de un niño con los modelos de lenguaje
grandes (LLMs), señalando que los niños adquieren conocimiento a través de la experiencia
directa mucho más que mediante el lenguaje. Además, argumentó que la inteligencia humana
es difícil de cuantificar y generalizar, ya que es altamente especializada y no lineal.
LeCun visualiza un futuro donde cada interacción digital estará mediada por asistentes de IA,
operando a través de dispositivos como las gafas inteligentes. Este futuro, sin embargo,
requiere que la IA pueda comprender y interactuar con una amplia gama de culturas,
idiomas y necesidades individuales.
Finalmente, LeCun enfatizó la importancia de un enfoque colaborativo y abierto hacia
el desarrollo de la IA. Propone que el conocimiento necesario para avanzar en la IA no
puede ser monopolizado por unas pocas empresas y debe ser accesible
como lo es Internet o Wikipedia.
LeCun reafirma que, aunque el desarrollo de una inteligencia a nivel humano está lejos,
es inevitable. Critica las visiones alarmistas sobre la IA, sugiriendo que, en lugar de temer,
deberíamos trabajar hacia una integración responsable de la IA en la sociedad.
---
Sin más ni menos, nos despedimos hasta mañana, donde hablaremos de lo que esperamos
de la IA ya, se está poniendo la cosa caliente, caliente…
GPT 5, o mejor dicho GPT Live… y es que parece que está en su punto de ebullición,
suena a que lo vamos a catar en breve,
Hablaremos de las nuevas noticias qué lo están surgiendo…
estará equivocado LeCun?
Según el jefe de IA de Meta, queda demasiado para la AGI,
escucharemos voces que nos cuentan lo contrario…
No te lo pierdas…
(((La frase de IA HOY es del protagonista del episodio. LeCun lo tiene claro…)))
La mayor parte de lo que sabemos como humanos proviene de nuestras experiencias del mundo, no proviene del lenguaje. Tenemos una impresión porque tenemos una inclinación lingüística, pero de hecho, la mayor parte de nuestro conocimiento que damos por sentado proviene de nuestra experiencia e interacción con el mundo real.
Cualquier joven de 17 años puede aprender a conducir un automóvil con 20 horas de práctica. Todavía no tenemos coches autónomos de nivel 5, a menos que hagamos trampa con sensores, mapas y esas cosas.
Gracias por estar, y gracias por escuchar, es muy humano por tu parte…
Vuelva usted mañana.
Yann LeCun, de Meta, quiere deshacerse de la IA generativa (aibusiness.com) (https://aibusiness.com/nlp/meta-s-yann-lecun-wants-to-ditch-generative-ai)
V-JEPA: The next step toward advanced machine intelligence (meta.com) (https://ai.meta.com/blog/v-jepa-yann-lecun-ai-model-video-joint-embedding-predictive-architecture/)
Gipitune del episodio
LeCun, Visión Futura, Rimas y Flow
[Verse 1]
AIberto Floppy, siempre en la movida,
Hablando de IA, que cambia la vida.
LeCun en la escena, con sus teorías,
Meta al mando, con nuevas tecnologías.
[Verse 2]
JEPA y V-JEPA, qué innovación,
Visiones de futuro sin limitación.
Criticando la IA, sin contemplación,
LeCun lo tiene claro, sin imitación.
[Chorus]
IA, IA, qué mareo,
Nos lleva en un viaje, siempre con deseo.
Desde la visión hasta el video,
LeCun y sus ideas, en el rodeo.
[Verse 3]
Autónomos que aprenden, casi como niños,
Sin necesidad de trucos ni de guiños.
Meta avanza, sin ponerse paños,
En un mundo digital, lleno de apaños.
[Bridge]
Pero tranqui, no hay que asustarse,
El futuro de la IA es para abrazarse.
Entre chips y códigos, va a jugarse,
LeCun lo dice claro, lo dice sin cortarse.
[Verse 4]
Con gafas inteligentes, y un poco de flow,
El digital assistant, ya está en el show.
Visiones compartidas, y un mundo nuevo,
LeCun en sus gafas, poniendo el huevo.
[Chorus]
IA, IA, qué mareo,
Nos lleva en un viaje, siempre con deseo.
Desde la visión hasta el video,
LeCun y sus ideas, en el rodeo.
[Bridge]
Explorando el audio, y el contexto real,
V-JEPA nos muestra, un camino ideal.
Con aprendizaje propio, y un modo genial,
Meta no se para, en este carnaval.
[Verse 5]
Desde Paris a Nueva York, la historia es larga,
LeCun con su IA, que a todos embarga.
Con premios y logros, su carrera carga,
Un futuro brillante, nada le amarga.
[Verse 6]
En la academia y Meta, su dualidad,
LeCun sigue firme, con calidad.
IA que predice, con gran habilidad,
Un mundo mejor, con su claridad.
[Chorus]
IA, IA, qué mareo,
Nos lleva en un viaje, siempre con deseo.
Desde la visión hasta el video,
LeCun y sus ideas, en el rodeo.
[Outro]
Así que dale play, si quieres respuesta,
El mundo de la IA, es una fiesta.
Con LeCun a la cabeza, y Meta en la gesta,
Nos vamos despidiendo, en esta floresta.