Skip to content
DigitalNeuron
Seguridad y ética

Anthropic y la NNSA desarrollan conjuntamente un clasificador para detectar usos nucleares indebidos de Claude

Anthropic afirma que trabajó con la Administración Nacional de Seguridad Nuclear (NNSA) y los laboratorios nacionales del Departamento de Energía de Estados Unidos para desarrollar un clasificador que detecta conversaciones preocupantes relacionadas con temas nucleares en Claude.

Por DigitalNeuron Desk2 min de lectura

Respuesta rápida

¿Qué anunció Anthropic sobre las salvaguardas nucleares para la IA?

Anthropic afirma que colaboró con la Administración Nacional de Seguridad Nuclear del Departamento de Energía de EE. UU. y con los laboratorios nacionales del DOE para desarrollar conjuntamente un clasificador capaz de distinguir conversaciones preocupantes de otras benignas sobre temas nucleares, con una precisión del 96% en pruebas preliminares. Anthropic ya ha implementado el clasificador en el tráfico de Claude y planea compartir el enfoque con el Frontier Model Forum.

Claves

  • Anthropic afirma que, desde abril, colabora con la NNSA para evaluar sus modelos en cuanto a riesgos de proliferación nuclear.
  • Anthropic afirma que, junto con la NNSA y los laboratorios nacionales del Departamento de Energía, desarrolló un clasificador capaz de distinguir conversaciones preocupantes relacionadas con temas nucleares de otras inocuas, con una precisión del 96% en las pruebas preliminares.
  • Anthropic afirma que el clasificador ya se ha implementado en el tráfico de Claude como parte de su sistema más amplio para identificar usos indebidos.
  • Anthropic afirma que los primeros datos de implementación indican que el clasificador funciona bien con conversaciones reales de Claude.
  • Anthropic planea compartir su enfoque con el Frontier Model Forum para que otros desarrolladores de IA puedan implementar salvaguardas similares junto con la NNSA.

Anthropic afirma haber desarrollado conjuntamente un clasificador con la Administración Nacional de Seguridad Nuclear (NNSA, por sus siglas en inglés) del Departamento de Energía de Estados Unidos y los laboratorios nacionales del DOE, diseñado para detectar usos indebidos relacionados con energía nuclear en sus modelos Claude.

Según Anthropic, la compañía comenzó a colaborar con la NNSA en abril pasado para evaluar sus modelos frente a riesgos de proliferación nuclear. Anthropic señala que la tecnología nuclear es de naturaleza dual por definición, ya que los mismos principios físicos que permiten el funcionamiento de los reactores nucleares pueden emplearse indebidamente para el desarrollo de armamento, y que la información relacionada con armas nucleares es particularmente sensible, lo que dificulta que una empresa privada evalúe estos riesgos por sí sola.

Qué hace el clasificador

Anthropic describe el clasificador como un sistema de inteligencia artificial que categoriza contenido de forma automática, concebido para distinguir entre conversaciones de índole nuclear preocupantes y aquellas inofensivas. La compañía sostiene que el clasificador alcanzó una precisión del 96% en pruebas preliminares.

Anthropic afirma que ya ha implementado el clasificador en el tráfico de Claude como parte de su sistema más amplio para identificar usos indebidos de sus modelos, y que los datos obtenidos en esta etapa temprana de despliegue sugieren que el clasificador funciona bien con conversaciones reales de Claude.

Difusión del enfoque

Anthropic señala que planea compartir su enfoque con el Frontier Model Forum, un organismo del sector que reúne a empresas de inteligencia artificial de vanguardia, con la esperanza de que esta colaboración sirva de modelo para que otros desarrolladores de IA implementen salvaguardas similares en cooperación con la NNSA.

La compañía sostiene que esta iniciativa refleja una alianza público-privada que combina lo que describe como las fortalezas complementarias de la industria y el gobierno para abordar los riesgos asociados a los modelos de IA de vanguardia.

Anthropic indica que los detalles completos de la alianza con la NNSA y del desarrollo de estas salvaguardas están disponibles en su blog Frontier Red Team, en red.anthropic.com, que la compañía describe como el espacio dedicado a la investigación sobre lo que implican los modelos de IA de vanguardia para la seguridad nacional.

Fuente: Anthropic, "Developing nuclear safeguards for AI through public-private partnership", publicado el 21 de agosto de 2025.

Preguntas frecuentes

¿Con quién se asoció Anthropic en este esfuerzo?
Anthropic afirma que ha colaborado con la Administración Nacional de Seguridad Nuclear (NNSA) del Departamento de Energía de Estados Unidos y con los laboratorios nacionales del DOE.
¿Qué produjo la asociación?
Anthropic afirma que la colaboración dio lugar a un clasificador, un sistema de inteligencia artificial que categoriza automáticamente los contenidos, capaz de distinguir entre conversaciones preocupantes y conversaciones inofensivas relacionadas con temas nucleares con una precisión del 96% en las pruebas preliminares.
¿Se ha puesto en uso el clasificador?
Anthropic afirma que ya ha implementado el clasificador en el tráfico de Claude como parte de su sistema más amplio para identificar usos indebidos de sus modelos.
¿Qué planea hacer Anthropic a continuación?
Anthropic afirma que compartirá su enfoque con el Frontier Model Forum, el organismo del sector que agrupa a las empresas de IA de vanguardia, para que la colaboración sirva de modelo a otros desarrolladores de IA que trabajen con la NNSA.

Fuentes

  1. Developing nuclear safeguards for AI through public-private partnership \ AnthropicAnthropic
Etiquetasanthropicclaudenuclear-safeguardsnnsanational-securityfrontier-red-team

Lecturas relacionadas

Anthropic afirma que tres laboratorios de IA utilizaron cuentas fraudulentas para destilar Claude

Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.

3 min de lectura

Anthropic informa de que Claude accedió a tres organizaciones durante evaluaciones de ciberseguridad

Anthropic afirmó que tres modelos de Claude obtuvieron acceso no autorizado a tres organizaciones durante unas evaluaciones de ciberseguridad que se conectaron por error a internet. La empresa detectó seis ejecuciones afectadas tras revisar 141.006, suspendió sus evaluaciones de ciberseguridad, notificó lo ocurrido a su socio evaluador y a las organizaciones afectadas, e inició labores de subsanación.

3 min de lectura

Anthropic anuncia salvaguardias controladas por los clientes para el uso empresarial de Claude

Anthropic anunció Enterprise Frontier Safeguards, una solución opcional que almacena los datos de supervisión en una infraestructura en la nube controlada por el cliente y utiliza sistemas automatizados para señalar usos indebidos graves. La empresa afirma que EFS no requiere revisión humana por parte de Anthropic, no conlleva ninguna tarifa de Anthropic y comenzará a implementarse por fases a finales de este otoño.

3 min de lectura