El reciente artículo de Towards AI titled MCP Isn't Dead, Your Tool List Is Too Big plantea una reflexión crítica sobre la gestión de los recursos de contexto en los flujos de trabajo con modelos de lenguaje avanzados. A través de la experiencia del autor, que utilizó cuatro servidores MCP y una sesión de Claude Code, se observa que antes de escribir el primer prompt real, casi un tercio del ventanal de contexto ya estaba ocupado por datos provenientes de los servidores. Este escenario evidencia cómo la proliferación de herramientas puede convertirse en una carga invisible que afecta la eficiencia y el coste de cada interacción.
El protocolo MCP, introducido por Anthropic, permite a las aplicaciones externalizar partes del contexto a través de servidores especializados que suministran información relevante sin saturar el token limit subyacente al modelo. Sin embargo, la práctica de conectar múltiples servidores simultáneamente genera una acumulación de datos que, aunque sean útiles, reducen el espacio disponible para la entrada del usuario y, por ende, la precisión de las respuestas. En el caso descrito, los cuatro servidores aportaban resúmenes de documentación, historial de conversaciones y métricas de rendimiento, consumiendo aproximadamente 33% del contexto antes de que el prompt principal pudiera ser procesado.
Claude Code, la herramienta de generación y revisión de código basada en el modelo Claude, representa otro punto crítico. Su funcionamiento se basa en mantener una sesión activa que incluye no solo el código que se está editando, sino también el historial de cambios, los tests ejecutados y los resultados de análisis estático. Cuando el usuario abre una nueva conversación, el motor tiende a cargar todo ese historial en el contexto, lo que explica por qué, en el ejemplo, casi un tercio del ventanal se agotó antes de que el prompt real fuera introducido. Este comportamiento subraya la necesidad de equilibrar la profundidad del contexto con la brevedad del mensaje inicial.
Para mitigar este problema, los desarrolladores deben adoptar una estrategia de curación de herramientas que priorice la relevancia y la eficiencia del contexto. Primero, es recomendable limitar el número de servidores MCP activos a aquellos que aportan información esencial para la tarea en curso; por ejemplo, un servidor de documentación y otro de métricas pueden ser suficientes, mientras que servicios especializados que suministran datos de bajo valor añadido pueden ser desactivados temporalmente. En segundo lugar, la implementación de mecanismos de "context trimming" permite eliminar automáticamente los fragmentos menos relevantes antes de que el modelo reciba el prompt principal, preservando así la capacidad de respuesta sin sacrificar la calidad del análisis.
Otro aspecto a considerar es la optimización del propio Claude Code. La herramienta permite configurar la profundidad del historial que se envía al modelo, de modo que se pueda limitar la cantidad de versiones de código guardadas o los logs de depuración que consumen tokens. Además, la adopción de técnicas de retrieval-augmented generation (RAG) puede reducir la dependencia del contexto histórico, ya que el modelo consulta fuentes externas en tiempo real en lugar de cargar todo el pasado en el ventanal. Esta combinación de ajustes permite que el usuario empiece a escribir su prompt con la certeza de que el modelo dispone de suficiente capacidad para comprender y responder.
En definitiva, la lección es clara: la abundancia de herramientas no siempre se traduce en mayor productividad, y el manejo responsable del contexto es tan crucial como la elección de los modelos mismos. Al consolidar servidores, ajustar la configuración de Claude Code y aplicar técnicas de RAG, los profesionales de IA pueden maximizar la eficiencia, reducir costos de tokens y ofrecer respuestas más precisas, consolidando así la verdadera ventaja competitiva en un ecosistema donde cada token cuenta.