La convergencia semántica se ha convertido en el talón de Aquiles silencioso de los grandes modelos de lenguaje. Aunque la industria celebra la coherencia y la alineación, un artículo reciente en arXiv (2608.02618v1) pone números a una sospecha extendida: las LLMs tienden a una "mente colmena" artificial que aplasta la diversidad de respuestas incluso en preguntas abiertas, alcanzando similitudes coseno de 0,85-0,90 entre generaciones independientes.
El fenómeno, bautizado como "Artificial Hivemind" por los autores, implica que, subida la temperatura o no, los modelos colapsan hacia un consenso estadístico predecible. Esto no es solo un problema estético: en tareas de lluvia de ideas, redacción creativa, simulación de opinión pública o generación de datos sintéticos para entrenamiento, la falta de variabilidad tipológica reduce la utilidad práctica y sesga los benchmarks de evaluación.
La solución propuesta combina dos mecanismos ortogonales. Primero, Meta-Persona Anchoring: se pide al modelo que auto-seleccione una "persona" idiosincrásica antes de responder, desplazando el punto de partida latente fuera del atractor consensuado. Segundo, Filtered Temperature Scaling (FTS): un tamiz de muestreo en dos fases —filtrado Top-p para保证 corrección gramatical y, sobre los candidatos supervivientes, un escalado de temperatura extremo (T ≥ 4,0) que explota la cola de la distribución de probabilidad ampliada por la persona adoptada.
Evaluado sobre el dataset INFINITY-CHAT con modelos abiertos de ~20B parámetros, el marco reduce la similitud coseno media pareada de ~0,85 a ~0,65. Lo crítico: la mayoría de preguntas caen por debajo del umbral 0,7, zona donde empieza a parecerse a la diversidad tipológica humana. El código se libera como framework open-source, listo para integrarse en pipelines de generación diversa.
¿Por qué importa ahora? La carrera por modelos "más inteligentes" ha priorizado la convergencia hacia respuestas "correctas". Pero agentes autónomos, gemelos digitales y sistemas multi-agente necesitan disenso simulado, no consenso. Esta técnica ofrece una palanca ligera —sin fine-tuning, sin RLHF— para inyectar entropía controlada donde se requiere creatividad o cobertura de espacio de soluciones.
Queda por ver cómo escala en modelos frontera cerrados (GPT-4o, Claude 3.5) y si la ganancia de diversidad degrada factualidad en tareas de razonamiento estricto. Pero la dirección es clara: la próxima frontera no es solo "pensar mejor", sino "pensar distinto".