Revista HUMANía

EE. UU. construye mundos; China construye el ecosistema

HackerNoon

Leer en el medio original (se abre en una pestaña nueva)

Imagen creada con IA · Modelo: gpt-image-2.

La próxima frontera de la IA quizá no sea hablar mejor. Será entender dónde está.

World Labs, la compañía de Fei-Fei Li, presentó Atlas, un modelo que combina imágenes, vídeo, texto e información 3D para reconstruir espacios navegables. No genera simplemente una imagen convincente: intenta mantener un mundo coherente cuando cambiamos nuestro punto de vista.

La diferencia parece pequeña hasta que pensamos en robots, coches autónomos o máquinas que tengan que interactuar físicamente con nosotros. Un chatbot puede inventarse una pared y nadie resulta herido. Un robot tiene menos margen para la creatividad literaria.

Dos caminos hacia el mismo mundo

Aquí aparece China.

Yingsu desarrolla InSpatio-World, un sistema abierto que parte del vídeo para reconstruir escenas dinámicas en cuatro dimensiones: espacio más tiempo.

Pero lo interesante no es decidir si Atlas o InSpatio-World es mejor. Es cómo están llegando hasta allí.

World Labs representa bastante bien el modelo estadounidense: investigadores estrella, enormes cantidades de capital privado y una tecnología nacida de la investigación que termina convertida en producto propietario.

Yingsu representa otra estrategia: código abierto, benchmarks públicos, colaboración universitaria y construcción de infraestructura compartida.

Estados Unidos está creando empresas alrededor de los modelos del mundo.

China parece querer crear también el ecosistema alrededor de ellos.

 

El fantasma de ImageNet

Y aquí aparece una ironía histórica bastante deliciosa.

En 2009, Fei-Fei Li impulsó ImageNet, la gigantesca base de imágenes etiquetadas que proporcionó el combustible para algunos de los avances fundamentales del aprendizaje profundo.

Ahora su empresa desarrolla modelos espaciales mientras, al otro lado del Pacífico, investigadores e instituciones chinos impulsan SIDO, una iniciativa para construir una gran base abierta de datos 3D y 4D destinada precisamente a entrenar inteligencia espacial.

El paralelismo es difícil de ignorar.

Hace diecisiete años, Fei-Fei Li ayudó a demostrar que los datos podían desbloquear una nueva generación de IA.

Ahora China parece apostar por repetir esa jugada con el mundo tridimensional.

No necesariamente creando primero el mejor modelo, sino intentando construir el ImageNet de la IA física.

 

De las palabras al mundo

La batalla interesante, por tanto, no es Atlas contra InSpatio-World.

Es algo bastante mayor.

Por un lado, el modelo estadounidense de empresa, capital y tecnología propietaria. Por otro, una estrategia china que combina empresas con código abierto, universidades, benchmarks y grandes conjuntos de datos compartidos.

Dos caminos diferentes hacia la misma obsesión: conseguir que una IA deje de limitarse a reconocer objetos y empiece a comprender cómo funciona el espacio que los contiene.

Durante años hemos enseñado a las máquinas a hablar sobre el mundo.

Ahora empieza la carrera por enseñarles a vivir dentro de él.

Y quizá el activo decisivo vuelva a no ser el modelo.

Quizá, como ocurrió con ImageNet, sean los datos.

Arriba