La navegación en espacios complejos y densamente poblados, como tiendas, almacenes y hospitales, es un desafío significativo para los humanos y los sistemas de inteligencia artificial (IA) incorporados. En estos entornos, las características visuales densas se vuelven rápidamente estancadas debido a la naturaleza casi estática de los objetos, y las distribuciones semánticas de larga cola desafían a la visión tradicional. Si bien los modelos de visión-lenguaje (VLM) ayudan a los sistemas de asistencia a navegar espacios semánticamente ricos, aún luchan con el arraigo espacial en entornos concurridos.

En un intento por abordar este desafío, un equipo de investigadores presentó GIST (Grounded Intelligent Semantic Topology), un pipeline de extracción de conocimiento multimodal que transforma un punto nubarrón de consumo de alta gama en una topología de navegación semánticamente anotada. Esta tecnología revolucionaria puede mejorar la habilidad de los sistemas de asistencia para navegar espacios densamente poblados y semánticamente ricos, como tiendas, almacenes y hospitales.

GIST distingue tres etapas clave en su arquitectura:

  1. Creación de un mapa de ocupación 2D: El pipeline de GIST comienza creando un mapa de ocupación 2D de la escena, lo que le permite identificar espacios vacíos y ocupados.
  2. Extracción de la topología del layout: A continuación, GIST extrae la topología del layout de la escena, lo que incluye la identificación de patrones y relaciones entre objetos.
  3. Superposición de una capa semántica: Finalmente, GIST superpone una capa semántica sobre la topología del layout, lo que le permite asignar significados y etiquetas a los objetos y espacios.

Los investigadores demostraron la versatilidad de GIST a través de varias tareas de interacción humano-IA críticas, incluyendo:

  • Motor de búsqueda semántica: GIST puede inferir categorías alternativas y zonas cuando los matches exactos fallan.
  • Localizador semántico: GIST puede localizar objetos y espacios con un error de traducción top-5 de 1,04 metros.
  • Clasificación de zonas: GIST puede segmentar el plano de piso en regiones semánticas de alto nivel.
  • Generador de instrucciones visuográficas: GIST puede sintetizar rutas óptimas en lenguaje natural y ricas en puntos de referencia.

En evaluaciones LLM multicriterio, GIST superó a los baselines de generación de instrucciones secuenciales. Además, una evaluación formativa in-situ con cinco participantes reveló un éxito de navegación del 80% dependiendo solo de señales verbales, lo que valida la capacidad de GIST para un diseño universal.

La investigación sobre GIST destaca la importancia de la integración de la visión, el lenguaje y la navegación en la creación de sistemas de asistencia más efectivos y accesibles. La aplicación de esta tecnología en espacios públicos y privados puede mejorar la experiencia de los usuarios y facilitar la interacción en entornos complejos.