DeepSeek ha vuelto a poner el foco en la volatilidad del mercado de APIs de modelos abiertos. La startup china, célebre por democratizar el acceso a modelos de razonamiento potentes a precios de derribo, ha anunciado una reestructuración de su tarifa que ha encendido las alarmas en la comunidad de desarrolladores: lo que presenta como un "descuento" por uso de caché de contexto (context caching) supone, en la inmensa mayoría de casos de uso reales, un encarecimiento efectivo de hasta 4 veces respecto a su tarifa plana anterior.

Hasta ahora, DeepSeek cobraba una tarifa plana extremadamente agresiva —0,14 $ por millón de tokens de entrada y 0,28 $ por salida— que la convertía en la alternativa económica indiscutible frente a GPT-4o o Claude 3.5 Sonnet. La nueva estructura establece un precio base de 0,27 $/M tokens de entrada (casi el doble) y 1,10 $/M de salida (casi 4x), aplicando un descuento del 90% (0,027 $/M) *solo* si los tokens de entrada provienen de un prefijo cacheado previamente.

El problema estructural es que el caching de contexto solo beneficia escenarios muy específicos: prompts de sistema largos y repetitivos, RAG con documentos fijos, o agentes que mantienen historial de conversación extenso. Para el caso de uso estándar —peticiones únicas, prompts cortos, inferencia stateless— el desarrollador paga el precio base "castigo". En la práctica, DeepSeek ha pasado de ser la opción "barata por defecto" a ser más cara que GPT-4o-mini (0,15 $/M entrada / 0,60 $/M salida) o Gemini 1.5 Flash para cargas de trabajo genéricas.

Esta maniobra recuerda a las estrategias de "bait-and-switch" vistas en la nube: atraer cuota de mercado con precios insostenibles (subsidiados por capital de riesgo o estrategia de pérdida) y subir tarifas una vez que el ecosistema ha construido dependencia técnica. La diferencia es que DeepSeek no tiene el *lock-in* de un modelo propietario cerrado; sus pesos son abiertos. Cualquier proveedor de inferencia (Together.ai, Fireworks, Hyperbolic, Groq) puede servir DeepSeek-V3 o R1 a márgenes menores.

Para el profesional técnico, la lección es clara: la commodity real no es el modelo, sino la capa de inferencia. Apostar la arquitectura de producto a un único proveedor de API —por muy abierto que sea el modelo— reintroduce el riesgo de proveedor (vendor lock-in) que el open-weight prometía eliminar. La estrategia robusta pasa por abstraer la capa de inferencia (vía frameworks como LiteLLM, LangChain o routers propios) para poder saltar entre proveedores en segundos ante cambios de precio, latencia o SLA.

DeepSeek sigue siendo un actor crucial para la soberanía tecnológica y la competencia, pero este movimiento erosiona la confianza. En un mercado donde los márgenes de inferencia tienden a cero, la diferenciación vendrá de la fiabilidad del servicio, no de trucos contables en la factura.