En un movimiento que podría redefinir cómo las máquinas理解 imágenes y texto de forma conjunta, H Company ha presentado NeoMME, una familia de codificadores multimodales que prescinde de componentes que hasta ahora se consideraban esenciales en este tipo de arquitecturas.

A diferencia de los sistemas ColPali-style que dominan actualmente el mercado de recuperación visual, NeoMME introduce una aproximación radicalmente diferente: todo el procesamiento ocurre dentro de un único Transformer, sin torre de visión pretrained ni decodificador causal. Esta decisión arquitectónica no es menor, ya que implica que el modelo aprende a procesar patches de imágenes de 32×32 píxeles y tokens de texto multilingual desde cero, de forma unificada.

Los resultados publicados en ViDoRe v3 revelan que el modelo de 260M parámetros alcanza un nDCG@10 de 0.523, una cifra competitiva para su tamaño. Pero lo más llamativo quizás sea la eficiencia operativa: el índice de compresión alcanza un ratio de 255×, mientras que el throughput de indexación llega a 51.3 páginas por segundo utilizando una sola GPU L40S. Estas métricas posicionan a NeoMME como una alternativa viable para implementaciones en producción con recursos limitados.

El secreto técnico reside en el objetivo de preentrenamiento: masked discrete-diffusion. Este método permite al modelo aprender representaciones densas de ambos modalidades sin las limitaciones de los flujos causales tradicionales. Además, NeoMME incorpora heads duales de recuperación que combinan la densidad de los embeddings tradicionales con la flexibilidad de la interacción tardía, capturando así mejores señales semánticas.

Ahora bien, los propios autores reconocen ciertas limitaciones. Existen brechas de rendimiento entre la recuperación puramente textual y la multimodal, lo que sugiere que todavía hay espacio para mejorar la alineación entre ambas modalidades. También queda por ver cómo escala esta arquitectura con datasets significativamente mayores.

Para el ecosistema hispanohablante, esta innovación tiene implicaciones directas. Los sistemas de búsqueda multimodal en español podrían beneficiarse de modelos más pequeños y eficientes, democratizando el acceso a tecnología que hasta ahora requería infraestructura considerable. La capacidad de procesar texto multilingual de forma nativa también sugiere aplicaciones inmediatas en catalogación de contenido, sistemas de recomendación y asistentes documentales.

El enfoque de H Company representa un cambio de paradigma interessante: en lugar de agregar componentes especializados, simplificar la arquitectura a su mínima expresión. Si los resultados se replican en benchmarks adicionales, podríamos estar ante el comienzo de una nueva generación de modelos multimodales más accesibles y eficientes.