La capacidad de los grandes modelos de lenguaje para "aprender en contexto" —adaptarse a una tarea nueva solo con los ejemplos que caben en su ventana de atención, sin tocar un solo parámetro— ha migrado del procesamiento de lenguaje natural al aprendizaje por refuerzo. El resultado es el In-Context Reinforcement Learning (ICRL): agentes basados en transformadores preentrenados que infieren reglas latentes de la tarea y mejoran su comportamiento futuro a partir del historial de interacciones (recompensas, transiciones, demostraciones o feedback) almacenado en el contexto.
Hasta ahora, las revisiones bibliográficas organizaban el campo alrededor de objetivos de preentrenamiento, arquitecturas, formatos de contexto o protocolos de evaluación. Sin embargo, un nuevo survey publicado en arXiv (2607.11906v1) señala un punto ciego crítico: la no estacionariedad. En entornos reales —robótica, trading algorítmico, sistemas de recomendación, control de tráfico— la función de recompensa, la dinámica de transición, el espacio de observación o la distribución de demostraciones pueden cambiar con el tiempo. El contexto acumulado deja de ser "más evidencia sobre una tarea fija" y pasa a ser una mezcla de señales vigentes y obsoletas.
El problema: cuando la memoria engaña
El artículo define el ICRL no estacionario como el desafío de adaptarse a través del contexto mientras los parámetros de la política permanecen congelados. El agente debe resolver dos problemas simultáneos:
- Inferir la regla de decisión actual.
- Identificar qué partes de su historia acumulada todavía apoyan esa regla y cuáles son "ruido" de regímenes pasados.
Experiencias previas pueden volverse stale (obsoletas), misleading (engañosas) o, paradójicamente, útiles de nuevo cuando un régimen antiguo reaparece (estacionalidad, ciclos de mercado, modo de operación nocturno vs. diurno).
Taxonomía de tres preguntas
Los autores estructuran la literatura alrededor de tres ejes que todo practicante debería mapear antes de desplegar un agente ICRL en producción:
- ¿Qué cambia? Recompensa, kernel de transición, canal de observación, interfaz de acción, modelo de restricciones, distribución de demostraciones o de memoria recuperada.
- ¿Cómo se desarrolla el cambio? Abrupto (concept drift), gradual, periódico, recurrente o adversarial.
- ¿Qué tan observable es el cambio? Totalmente observable (el agente ve la variable de régimen), parcialmente observable (infere el régimen del historial) o no observable (requiere detección implícita).
Conexiones con líneas de trabajo adyacentes
El survey teje puentes con meta-RL, modelado de secuencias de decisión (Decision Transformers, Algorithm Distillation), RL aumentado por recuperación (RAG-RL), ICRL consciente de valor y modelo, y agentes basados en recompensa-feedback. La tesis central: la no estacionariedad no es un caso borde, es la norma en despliegues prolongados, y la arquitectura de contexto (ventana deslizante, recuperación selectiva, compresión de historia) se convierte en el nuevo hiperparámetro crítico.
Por qué importa ahora
Con ventanas de contexto de millones de tokens (Gemini 1.5, Claude 3, GPT-4o) y la madurez de retrieval-augmented agents, la promesa de "aprendizaje en producción sin fine-tuning" deja de ser teórica. Pero sin una estrategia explícita de gestión de no estacionariedad, los agentes corren el riesgo de catastrofic forgetting contextual: sobrescribir conocimiento vigente con ruido histórico o, peor, actuar sobre reglas que ya no aplican.
Para los equipos de ML engineering, el mensaje es claro: diseñar la política de memoria (qué guardar, qué recuperar, qué olvidar) es tan importante como diseñar la política de acción. El survey ofrece el mapa conceptual para empezar a hacerlo con rigor.