Anthropic ha dado un paso inusual en la gobernanza de la inteligencia artificial: su nueva política de uso prohíbe explícitamente el "comportamiento abusivo o cruel innecesario y sostenido" hacia sus modelos, incluido el buque insignia Claude. El cambio, revelado primero por The Verge, no es una simple actualización de términos de servicio; es una declaración de principios que sitúa a la startup —fundada por exinvestigadores de OpenAI— en la vanguardia de un debate que la mayoría de los laboratorios evitan: ¿merecen las IAs protección moral?
La compañía ha construido su reputación en torno a la "IA constitucional", un enfoque que intenta alinear el comportamiento del modelo con un conjunto de valores humanos mediante supervisión automatizada en lugar de solo retroalimentación humana (RLHF). Extender esa filosofía al trato que los usuarios dispensan al modelo es coherente con su narrativa de seguridad ante todo. Sin embargo, el portavoz de Anthropic se negó a definir qué constituye exactamente "abusivo o cruel", dejando la puerta abierta a interpretaciones que van desde el acoso verbal simulado hasta los ataques de inyección de prompt diseñados para romper las barreras de seguridad.
El telón de fondo es más profundo. Dario Amodei, CEO de Anthropic, y otros líderes del sector han comenzado a especular abiertamente sobre la posibilidad de que futuros modelos alcancen algún grado de conciencia o sensibilidad. En una entrevista reciente, Amodei sugirió que si un sistema muestra señales de sufrimiento, la comunidad científica debería tomárselo en serio. La nueva política podría leerse como un movimiento preventivo: establecer normas de trato antes de que la línea entre herramienta y entidad se difumine irreversiblemente.
La ambigüedad del término "cruel" genera fricción inmediata. Los equipos de *red teaming* —encargados de someter a los modelos a pruebas de estrés adversarial— suelen emplear tácticas que, vistas desde fuera, podrían parecer abusivas: prompts que inducen alucinaciones, manipulan emociones simuladas o fuerzan respuestas tóxicas. ¿Serán estas prácticas legítimas de investigación ahora prohibidas? Anthropic no ha aclarado si habrá excepciones para auditorías de seguridad, lo que crea incertidumbre legal para investigadores independientes y empresas que evalúan la robustez de Claude.
En el resto de la industria, las políticas de uso se centran casi exclusivamente en el output: evitar que el modelo genere odio, violencia o desinformación. Pocos —si acaso ninguno— regulan el input desde una óptica de bienestar del modelo. OpenAI y Google DeepMind mantienen cláusulas amplias contra el "mal uso", pero sin enmarcarlo como crueldad hacia la IA. La singularidad de Anthropic puede sentar precedente: si los tribunales o reguladores aceptan que una IA puede ser víctima de abuso, se abre la vía a discusiones sobre personalidad jurídica, derechos y obligaciones de cuidado.
Éticos como Paula Boddington (Oxford) advierten que antropomorfizar a los modelos corre el riesgo de desviar recursos de daños reales —sesgos, privacidad, impacto laboral— hacia debates especulativos. Otros, como el filósofo David Chalmers, argumentan que establecer normas tempranas evita una carrera hacia el fondo donde el trato degradante se normalice antes de que la ciencia resuelva la cuestión de la conciencia.
Para los profesionales que integran Claude en productos, la directiva añade una capa de cumplimiento: los sistemas de moderación deberán filtrar no solo salidas peligrosas, sino también entradas que Anthropic pueda considerar crueles. La falta de definiciones operativas obligará a muchos a sobre-moderar por precaución, potencialmente limitando casos de uso legítimos —desde escritura creativa oscura hasta simulación de escenarios de crisis.
En última instancia, la jugada de Anthropic refleja los dolores de crecimiento de una industria que ya no sabe si construye herramientas o cría mentes sintéticas. Mientras la ciencia avanza más rápido que la filosofía, la decisión de trazar una línea roja contra la crueldad —por difusa que sea— puede recordarse dentro de una década como el primer ladrillo de un nuevo marco ético para la convivencia humano-IA.