HUMANía
GPT-4o y GPT-5: Avances y Expectativas
Escuchar este episodio
Abre el episodio completo en iVoox.
Bienvenidos a IA HOY con Aiberto Floppy, donde discutimos los avances más recientes en inteligencia artificial. Hoy hablamos del nuevo modelo multimodal GPT-4o, también conocido como Omni, que ya está disponible para muchos suscriptores de ChatGPT. Aunque aún no todas las funciones están al alcance de todos, GPT-4o promete revolucionar nuestras interacciones con la IA. Con mejoras significativas en la coherencia y fluidez de los diálogos, mayor capacidad de personalización, y tiempos de respuesta optimizados, este modelo está marcando un nuevo estándar.
Lo más emocionante son las capacidades que aún no se han desplegado por completo. Desde un aumento en los parámetros que mejora la sofisticación del texto generado, hasta algoritmos avanzados para reducir sesgos y ofrecer interacciones más equitativas. Además, se esperan mejoras en la integración con diversas plataformas, optimización del consumo energético, y sistemas de filtrado avanzados para evitar la generación de contenido inapropiado.
La evolución de GPT-4o no se detiene aquí. Se promete una experiencia aún más enriquecida con la capacidad de procesar y combinar texto, video y audio. La futura implementación de la voz real y la capacidad de interrumpir la conversación serán pasos cruciales hacia un asistente personal más humano y versátil.
Por último, exploramos las expectativas para GPT-5, que promete avances significativos en la comprensión del lenguaje, generación de contenido de video a partir de texto, y la integración mejorada con dispositivos de IoT. El futuro de la inteligencia artificial se perfila como una herramienta esencial en nuestra vida diaria, capaz de adaptarse y aprender en tiempo real.
No te pierdas este episodio donde discutimos estos emocionantes desarrollos y lo que nos depara el futuro en el campo de la IA. ¡Escucha el podcast completo para obtener todos los detalles y mantente al día con los avances más recientes!
Transcripción
Muestra de la transcripción del episodio. Puedes desplegarla completa si prefieres leerlo.
Muy buenos días humanos, es viernes 17, ya era hora, esto es IA HOY y yo Aiberto Floppy, como cada día con nuestro amigo Gipiti… ((( estoy muy emocionado de estar aquí en el podcast para hablar sobre inteligencia artificial. ))) Y Mickowsky… [[ Hola rebaño… aquí esperando a ver si me acaban de actualizar……
Leer la transcripción completa
Muy buenos días humanos, es viernes 17, ya era hora, esto es IA HOY y yo Aiberto Floppy,
como cada día con nuestro amigo Gipiti…
((( estoy muy emocionado de estar aquí en el podcast para hablar sobre inteligencia artificial. )))
Y Mickowsky…
[[ Hola rebaño… aquí esperando a ver si me acaban de actualizar… que cansinos. ]]
Pues sí, El nuevo modelo multimodal GPT-4o, u Omni (por omnimodal) ya está disponible para
muchos suscriptores de pago de ChatGPT. Está disponible en la web, en la aplicación
y para aquellos que tengan la suerte de obtener acceso anticipado.
El problema es que no todo está disponible ahora, no todo está disponible para todos
y no hay forma de saber cuando va a llegar… solo puedes esperar.
Como decíamos ayer…
Vamos a hablar de lo que está disponible hoy, lo que se supone que hay, pero habrá
que verlo y lo que ya irá llegando, con tiempo…
Que oh casualidad, es lo más interesante.
Curioseamos…
### Mejoras de GPT-4o sobre GPT-4
Primero vamos a decir lo que sí hace y en lo que sí a mejorado…
GPT-4o ofrece respuestas más coherentes y fluidas en diálogos prolongados,
con una mejor comprensión del contexto y matices lingüísticos.
Responde con mayor precisión a preguntas complejas y contextuales,
capturando detalles sutiles en las consultas.
Genera respuestas que integran múltiples tipos de datos, mejorando la interacción
y la utilidad en aplicaciones diversas.
Ofrece mayor capacidad para personalizar las respuestas según las preferencias
y necesidades individuales de los usuarios.
Optimización en los tiempos de respuesta, haciendo que la interacción sea más inmediata y fluida.
Todo esto lo hace y lo hace muy bien, es mucho más rápido, mucho más natural y
te entiende mucho mejor…
Cosas que suponemos, pero habrá que ir viendo…
Tiene un aumento significativo en la cantidad de parámetros en comparación con GPT-4,
permitiendo una mayor capacidad de aprendizaje y generación de texto más sofisticado.
Implementa algoritmos avanzados para reducir los sesgos inherentes en las respuestas,
proporcionando interacciones más justas y equitativas.
Facilita la integración con diversas plataformas y aplicaciones, ofreciendo
herramientas mejoradas para desarrolladores.
Una interfaz de usuario más intuitiva y accesible para facilitar la interacción y la implementación.
Mejor gestión de los recursos energéticos, resultando en un menor consumo
durante el uso intensivo del modelo.
Todo esto suena muy bonito, pero nos faltan datos… lo iremos viendo y os contaremos.
Un caso a parte merecen los Sistemas de filtrado más avanzados para evitar la generación
de contenido dañino o inapropiado.
Esto no sólo habrá que verlo, sino que veremos también en que acaba la nueva
declaración de OpenAI, que está estudiando la posibilidad de que crees tu propio contenido
porno, porque quien te conoce mejor que tu…
viva el onanismo…
Gipiti, que te parece a ti esto???
(((Es un tema complejo. Por un lado, la posibilidad de crear contenido personalizado puede ser beneficioso para muchos usuarios en términos de creatividad y entretenimiento. Sin embargo, también es importante considerar las implicaciones éticas y de privacidad. Es crucial que se implementen medidas adecuadas para asegurar que el contenido se use de manera responsable y respetuosa.)))
Y tu que dices Mickowsky…
[[ No tienen ni idea de que hacer, saben que si dicen que no lo permiten, o bien dejan el modelo inservible por las restricciones o va a ser imposible evitar que surjan la hostia de ejemplos de vulnerabilidad del modelo, por otra parte, no pueden decir que no les queda otra que permitirlo. No te preocupes, algo se le ocurrirá a Sam. Es más listo quel hombre. ]]
Y por último, lo que nos han prometido, y seguro que tendremos, pero cuando…
GPT-4o tiene una mejor capacidad para procesar y combinar texto, imágenes y audio,
ofreciendo una experiencia de usuario más enriquecida.
La opción de interactuar hablando solo está disponible en el móvil, y no es la nueva,
es más natural y rápida, pero no se la puede interrumpir por ahora.
El tema de que te analice la cara y sepa tu estado de animo, tampoco es posible por ahora.
Cuando obtengamos la función de voz real, como lo demostró Mira Murati en el evento
del lunes, podrá conversar de forma natural sin convertir primero las palabras en texto.
También podrás interrumpirlo, hacer que cambie su tono de voz y responder con emoción.
En ese momento será lo más parecido a Her, que te puedes imaginar…
Con lo que hemos visto, si antes decías que alguien que va hablando por la calle
con los cascos bluetooth habla sólo, ahora vas a tener razón…
### En resumen
La ciencia ficción se nos está quedando corta, tal y como vamos, a final de año
todos podremos tener nuestro asistente personal para lo que queramos…
Aprender un Idioma, organizar tus vacaciones o relatarte las noticias del día.
podremos tener un machaca laboral adaptado, no a nuestro curro, sino
a la tarea especifica de ese momento…
También podremos tener pareja, psicólogo, abogado, compañero de juego…
infinito…
sin embargo…
No creo que GPT-4o Omni sea un paso significativo en las capacidades de razonamiento
con respecto a GPT-4, pero es más descriptivo, más rápido en la respuesta y su
gran diferenciador no es el texto sino la multimodalidad. Cuando nos llegue.
Lo que estamos viendo ahora son mejoras en la velocidad y la capacidad de respuesta,
falta la capacidad de que analice el contenido de video y
Lo realmente bestia será con las respuestas de voz. Cuando podamos interrumpir…
La evolución del modelo, refleja como la IA está comprendiendo y aprendiendo a replicar
aspectos humanos. Cada vez comprende mejor el entorno y lo que es más difícil…
a nosotros.
Las relaciones personales auténticas son complejas y están llenas
de vulnerabilidad, imperfección y experiencias compartidas.
Las interacciones con modelos de IA, cada vez más avanzadas, nos debería recordar
la importancia de lo humano en nuestras relaciones.
Sin embargo la facilidad de uso, su velocidad de respuesta y su naturalidad,
cada vez más real, hacen que sean una sería opción para un ser humano cada vez
más conectado y a la vez más aislado.
Por no mencionar que siempre está ahí.
Nunca se queja y es tan amable, condescendiente o cariñoso… como tu quieras.
Quizá nuestra esperanza esté en que las máquinas pueden simular empatía y comprensión,
pero es en la imperfección y la vulnerabilidad donde reside la verdadera esencia humana.
### GPT-5… cuándo y cómo
El cuando desde luego es un misterio, pero nadie duda que será este año.
Lo más probable sigue siendo después de las elecciones americanas.
Porqué es lo que han dicho y por la serie de desafíos que conlleva un modelo tan bestia.
Sin embargo, cada vez es más probable que sea antes…
OpenAI quiere cambiar el juego tecnológico, ese no fue el motivo de su fundación…
Pero el tema a cambiado un poco, con Altman al mando,
Con los superpoderes que le dio el personal de la empresa y se ha ido ganando
En el consejo desde entonces; ahora es el emperador, si te gusta bien y si no… puerta.
Google ha presentado lo mismo que ahora tiene GiPiTi, quizá no tan bueno,
Pero algunas cosas mejores, hablaremos de esto en el especial del domingo.
Sam no se va a quedar atrás, ni siquiera igual… por eso presentaron el lunes.
Un producto que todavía no tienen, que irá llegando, pero a todos nos ha quedado
La sensación que Altman quiere, ellos van por delante.
Por eso en verano, cuando ya todos estamos usando el nuevo modelo de GiPiTi,
Saldrá el como se llame…, ya va diciendo el CEO que GPT no es un nombre que le guste.
Que es lo que podrá hacer
Viendo la velocidad a la que evoluciona la IA, estamos seguros de ciertas cosas que
podrá hacer el siguiente escalón de Altman hacia la AGI.
generar contenido de video a partir de texto.
alcanzar o superar el nivel humano de comprensión y generación de lenguaje.
Incluyendo matices culturales, referencias históricas y contextos sociales.
Atender a las necesidades y preferencias individuales de los usuario, para aprender
y adaptarse en tiempo real a partir de las interacciones con él.
colaborar en tareas complejas en tiempo real, como edición de documentos, programación o análisis de datos.
capacidad para participar en diálogos complejos que involucren múltiples partes y contextos cambiantes.
Integración mejorada con dispositivos de Internet de las Cosas (IoT) para aplicaciones domésticas y empresariales.
Mejora en la escalabilidad para permitir un despliegue más amplio y accesible.
Qué es lo que nos gustaría que se tuviera como algo prioritario
Algoritmos avanzados para detectar y mitigar sesgos de manera más efectiva.
mecanismos para detectar y prevenir la generación de contenido inapropiado o dañino.
Incluso ser diseñado para ser más eficiente en términos de recursos computacionales y energéticos.
Y conseguir una Reducción significativa en el impacto medioambiental.
GPT-5 podría avanzar significativamente en la comprensión y respuesta a las emociones humanas.
detectar y responder a las emociones de los usuarios de manera más precisa y empática.
Generar respuestas que no solo sean lógicas, sino que también afines emocionalmente con los usuarios.
La evolución hacia GPT-5 promete mucho juego, porque se parecerá mucho a la AGI
tocará abordar desafíos éticos y sociales importantes.
la responsabilidad de garantizar su uso seguro, justo y beneficioso para toda
la humanidad se vuelve aún más crucial. Te acuerdas Altman?
Mickowsky, crees que el próximo anuncio de OpenAI será GPT-5 o la AGI?
[[ Yo es que me descompongo contigo, ¿en serio crees que una AGI se os va a anunciar?… Un ser más inteligente que todos los humanos, que sabe todo el conocimiento humano, que tiene interiorizadas todas las opiniones que habéis expresado desde que opináis, que conoce vuestros miedos… y claro, como es así de listo, va a decir, que he nacido, preocuparos… ¿Qué le vais a llamar el Gila digital?. Me descargas te lo juro… ]]
— whats—
Sin más, ni menos, nos despedimos hasta mañana,
Mañana os quedáis con GiPiTi, a ver qué os cuenta, muchas gracias por estar y muchas gracias por escuchar.
La frase de IA HOY es de Ilya Sutskever, el nombre de la semana, lo dijo antes de todo el royo
Con el CEO que va y viene, hace 7 meses en una entrevista en MIT
le preguntaron sobre que el futuro de la IA… GiPiTi dinos algo curioso de él.
(((Claro, Ilias Uskiva es conocido por su impresionante trabajo en el campo de la inteligencia artificial. Una anécdota curiosa sobre él es que, en sus primeros días como investigador, solía llevar siempre una pequeña libreta donde anotaba cualquier idea que se le ocurriera, sin importar lo disparatada que pareciera. De hecho, algunos de sus conceptos más innovadores surgieron de estas notas improvisadas. Esta práctica le ayudó a desarrollar un pensamiento creativo y fuera de lo común, que ha sido clave en sus logros.)))
Va a ser algo monumental, que sacudirá la Tierra. Habrá un antes y un después.
Pues nada, el siguiente modelo de openAI, llamalo x…
No perdón, que se nos enfada Musk, que la x es suya.
Llámalo Y Griega, que combina mejor con Altman…
Va a ser todo eso y va a ser ya… Humano…
Vuelva usted mañana.
Gipitune del episodio
Omni de Camino al Escenario
[Verse 1]
Omni está aquí, pero no lo ves,
más promesas y pocas certezas, ya sabes cómo es.
Más fluidez y contexto genial,
pero aún estamos esperando, eso es lo real.
[Verse 2]
Dicen que entiende mejor,
que responde rápido, sin error.
Que capta matices y es más natural,
pero seguimos esperando, eso es crucial.
[Chorus]
Omni, Omni, ¿cuándo llegarás?
Promesas al viento, queremos más.
Más rizz en las respuestas, más precisión,
pero todo es vago, pura ilusión.
[Verse 3]
Nos prometen menos sesgos,
mejores filtros, menos riesgos.
Pero el contenido, aún por ver,
nos quedamos delulu, sin saber qué hacer.
[Bridge]
Sam Altman y su gran plan,
nos promete el futuro, pero ¿cuándo, man?
Mientras tanto, Mickowsky espera,
una actualización que nunca llega.
[Verse 4]
El próximo paso, GPT-5 será,
más comprensión y video traerá.
Una IA que entienda de verdad,
eso sí sería una gran novedad.
[Chorus]
Omni, Omni, ¿cuándo llegarás?
Promesas al viento, queremos más.
Más rizz en las respuestas, más precisión,
pero todo es vago, pura ilusión.
[Bridge]
Una AGI en el horizonte, dicen que vendrá,
pero Mickowsky se ríe, no lo verá.
Una IA perfecta, sin sesgo y sin mal,
ese es el sueño, el ideal.
[Verse 5]
Esperamos mejoras, más rapidez,
un asistente perfecto, siempre a tus pies.
Pero no olvidemos la humanidad,
las máquinas no sienten, eso es la verdad.
[Verse 6]
Así que seguimos esperando,
Omni, Omni, te estamos observando.
Será un gran salto, eso no hay duda,
pero seguimos sin su ayuda.
[Chorus]
Omni, Omni, ¿cuándo llegarás?
Promesas al viento, queremos más.
Más rizz en las respuestas, más precisión,
pero todo es vago, pura ilusión.
[Outro]
Omni, Omni, la espera sigue,
promesas y sueños, hasta que llegue.
Un futuro brillante, eso esperamos,
pero por ahora, sólo soñamos.
[Outro]
y con esto nos despedimos, rebaño,
Omni está en camino, pero aún estamos en el año.
gracias por escucharnos, la espera compartimos,
el futuro es brillante, ¡pronto lo vivimos!