Qué propone Anthropic

El director ejecutivo de Anthropic, Dario Amodei, publicó un plan para reducir de forma controlada el ritmo de desarrollo de la IA de vanguardia. No propone detener el entrenamiento de modelos: el objetivo es limitar temporalmente los avances en sus capacidades para que los investigadores tengan tiempo de reforzar las salvaguardias técnicas y organizativas. [1 · Dario Amodei] [2 · Reuters]

El primer paso consistiría en que evaluadores independientes obtuvieran acceso a modelos, datos de evaluación y procesos internos al mismo nivel que los empleados. Anthropic declaró estar dispuesta a adoptar esta práctica unilateralmente, sin esperar un acuerdo de toda la industria. [1 · Dario Amodei] [2 · Reuters]

Cómo funcionaría la coordinación

En la segunda etapa, los principales laboratorios de países democráticos acordarían estándares y límites para el desarrollo de modelos; Amodei reconoce que ello podría requerir excepciones especiales a las normas de competencia. La tercera etapa contempla coordinación internacional, incluidos países con otros sistemas políticos, aunque el autor reconoce la dificultad de verificar con fiabilidad estos compromisos. [1 · Dario Amodei] [2 · Reuters]

Amodei estima que una desaceleración coordinada podría aportar uno o dos años para trabajar en el alineamiento del comportamiento de los modelos con las intenciones humanas, la interpretabilidad, las evaluaciones y la seguridad operativa. Sus escenarios de ataques a gran escala por agentes autónomos siguen siendo advertencias de un directivo empresarial, no pronósticos establecidos. [1 · Dario Amodei] [2 · Reuters] [3 · Associated Press]

Comentario experto

Lo más significativo de la iniciativa es la posibilidad de que las afirmaciones de los laboratorios puedan verificarse. El acceso continuado de evaluadores externos podría reducir la distancia entre lo que sabe el desarrollador y lo que pueden comprobar los clientes y la sociedad. A mi juicio, este es un paso más tangible que prometer ganar un determinado número de meses. Pero el resultado dependerá de que los evaluadores puedan investigar casos incómodos y publicar conclusiones que afecten a los intereses comerciales de la empresa. [1 · Dario Amodei]

Las consecuencias competitivas pueden ir en direcciones opuestas. Unos requisitos comunes podrían convertir la seguridad verificada en una ventaja por sí misma y reducir los beneficios de apresurar los lanzamientos. Sin embargo, una vía de acceso al mercado costosa podría consolidar la posición de los mayores laboratorios. Por eso considero razonable vincular la profundidad de la evaluación a las capacidades peligrosas de cada sistema y a su escala de uso. Imponer costes iguales a un pequeño modelo aplicado y a un sistema autónomo de vanguardia puede restringir de forma desproporcionada a los nuevos participantes. [1 · Dario Amodei] [4 · NIST]

La teoría de juegos explica por qué la cautela voluntaria puede ser insuficiente. En el modelo de Armstrong, Bostrom y Shulman, bajo ciertos supuestos los participantes en una carrera tecnológica reducen las medidas de seguridad para llegar primeros. Es un mecanismo teórico, no una prueba de catástrofe inevitable. De él deduzco la necesidad de compromisos mutuos verificables: las promesas deben modificar las recompensas esperadas de los participantes; de lo contrario, cada uno seguirá temiendo que un competidor aproveche su prudencia. [5 · Armstrong, Bostrom y Shulman]

Para los clientes, entre los resultados útiles podrían estar unos procesos automatizados más predecibles y menos daños por acciones erróneas. Pero ralentizar la investigación no garantiza por sí mismo respuestas fiables ni protege los datos de una tienda o un banco concreto. Las organizaciones seguirán necesitando límites de autoridad, controles de las operaciones críticas y revisiones de incidentes. El efecto debe evaluarse sobre las tareas de los usuarios, incluidos los costes de corrección, y no solo sobre los resultados generales de evaluación de los modelos. [4 · NIST] [6 · Balesni y colaboradores]

A escala mundial, la iniciativa plantea quién define el riesgo aceptable. Amodei combina los acuerdos internacionales con la preservación de la ventaja tecnológica de Estados Unidos y sus aliados. En mi opinión, esto puede complicar la confianza entre países: la seguridad compartida y la rivalidad estratégica requieren incentivos diferentes. Un primer resultado más realista podría ser disponer de procedimientos de evaluación compatibles e intercambiar información sobre incidentes, aunque no se logre acordar un ritmo común de desarrollo. [1 · Dario Amodei]

Consideraré eficaz la iniciativa si aparecen informes independientes, información sobre las restricciones de acceso y ejemplos de decisiones modificadas tras la evaluación. Otras señales son el tiempo necesario para corregir las deficiencias detectadas y la repetición de conductas peligrosas en pruebas comparables. Un aumento inicial de los incidentes registrados podría reflejar una mejor detección, no peores modelos. Pero si solo se ralentizan los lanzamientos públicos y los sistemas internos siguen sin poder verificarse, el beneficio social de ese acuerdo será cuestionable. [1 · Dario Amodei] [6 · Balesni y colaboradores]

Fuentes

  1. Dario Amodei — We Must Pace the Frontier — 12 de septiembre de 2026
  2. Reuters — el responsable de Anthropic pide ralentizar el desarrollo de modelos — 12 de septiembre de 2026
  3. Associated Press — el plan de Dario Amodei y sus fundamentos — 12 de septiembre de 2026
  4. NIST — AI Risk Management Framework 1.0 — Base metodológica para evaluar riesgos, 2023
  5. Armstrong, Bostrom y Shulman — Racing to the Precipice — Modelo teórico; versión de trabajo de 2013, publicación en revista en 2016
  6. Balesni y colaboradores — fundamentar la seguridad a partir de resultados de evaluación — Prepublicación de investigación, 2024; los autores analizan las limitaciones de la evidencia