Resumen: Los modelos de inteligencia artificial generativa han tenido un gran impacto en muchas aplicaciones. Los modelos que son capaces de integrar texto, imágenes, audio y video permiten además extender esa inteligencia a muchas más aplicaciones que requieren procesar múltiples tipos de datos. En esta charla expondré algunos de los trabajos en nuestro grupo de investigación para mejorar estos sistemas de tal forma que puedan proveer respuestas rápidas ante preguntas simples pero al mismo tiempo sean capaces de deliberar una respuesta cuando sea requerido. Entre los temas cubiertos estará el tema de "visual grounding" para hacer que estos modelos anclen sus respuestas de texto en evidencia visual y el rol que tiene "image retrieval" o modelos de recuperación y búsqueda de imágenes en potenciar las capacidades de estos modelos.