Skip to content
DigitalNeuron
Seguridad y ética

Anthropic detalla su marco para evaluar los daños de la IA

Anthropic afirmó que está compartiendo un marco en evolución que evalúa los daños de la IA en cinco dimensiones, en complemento de su Política de Escalado Responsable.

Por DigitalNeuron Desk3 min de lectura

Respuesta rápida

¿Qué marco anunció Anthropic para evaluar los daños de la IA?

Anthropic afirmó que desarrolló un marco que evalúa los posibles daños de la IA en cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y en la autonomía individual. La compañía señaló que utiliza este marco junto con su Política de Escalado Responsable para orientar su Política de Uso, sus evaluaciones, sus labores de detección y sus medidas de aplicación, incluidas las relacionadas con el uso de computadoras y con Claude 3.7 Sonnet.

Claves

  • Anthropic presentó un marco para evaluar los daños de la inteligencia artificial en cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y en la autonomía individual.
  • La empresa afirmó que el marco complementa su Política de Escalado Responsable, centrada en los riesgos catastróficos, al abordar una gama más amplia de posibles daños.
  • En cuanto a su capacidad de uso del ordenador, Anthropic señaló que había detectado riesgos relacionados con el software financiero y las herramientas de comunicación, y respondió con umbrales de aplicación más estrictos y una técnica de resumen jerárquico.
  • Anthropic afirmó que la aplicación del marco a Claude 3.7 Sonnet redujo en un 45 % los rechazos innecesarios, al tiempo que mantuvo las salvaguardas frente a contenidos perjudiciales.
  • La empresa describió el enfoque como algo que aún está en evolución e invitó a investigadores externos y expertos en políticas públicas a colaborar.

Anthropic presenta un marco para evaluar daños

Anthropic anunció que está dando a conocer su enfoque, aún en evolución, para evaluar y mitigar diversos daños potenciales derivados de sus sistemas de IA, desde riesgos catastróficos, como las amenazas biológicas, hasta preocupaciones relacionadas con la seguridad infantil, la desinformación y el fraude.

La empresa señaló que el marco complementa su Política de Escalado Responsable, centrada específicamente en los riesgos catastróficos, al adoptar una perspectiva más amplia sobre otros tipos de repercusiones. Anthropic indicó que el enfoque sigue evolucionando y que comparte sus planteamientos actuales, que continuará desarrollando.

Cinco dimensiones del daño

Anthropic afirmó que evalúa las posibles repercusiones en cinco dimensiones básicas:

  • Repercusiones físicas: efectos sobre la salud y el bienestar corporal
  • Repercusiones psicológicas: efectos sobre la salud mental y el funcionamiento cognitivo
  • Repercusiones económicas: consecuencias financieras y consideraciones patrimoniales
  • Repercusiones sociales: efectos sobre las comunidades, las instituciones y los sistemas compartidos
  • Repercusiones sobre la autonomía individual: efectos sobre la toma de decisiones y las libertades personales

Para cada dimensión, la empresa indicó que considera factores como la probabilidad, la magnitud, las poblaciones afectadas, la duración, la causalidad, la contribución de la tecnología al daño y la viabilidad de mitigarlo.

Anthropic señaló que gestiona los riesgos detectados mediante el marco con una combinación de medidas: una Política de Uso; evaluaciones como ejercicios de equipo rojo y pruebas adversariales realizadas antes y después del lanzamiento; técnicas de detección destinadas a identificar usos indebidos; y medidas de cumplimiento que abarcan desde modificaciones de las instrucciones hasta el bloqueo de cuentas.

Ejemplos citados

Anthropic expuso dos ejemplos de cómo aplicó el marco.

En el caso de su función de uso de computadoras, que permite a los modelos interactuar con interfaces informáticas, la empresa explicó que examinó los riesgos asociados a programas financieros y plataformas bancarias, donde la automatización no autorizada podría facilitar el fraude o la manipulación, así como a herramientas de comunicación que podrían emplearse en operaciones de influencia dirigidas o campañas de suplantación de identidad. Anthropic señaló que este análisis la llevó a establecer umbrales de cumplimiento más estrictos y a utilizar la síntesis jerárquica, un método que, según la empresa, permite detectar daños sin renunciar a sus estándares de privacidad.

La empresa también describió su trabajo sobre lo que denominó límites de respuesta de los modelos, relativo a cómo estos gestionan solicitudes situadas entre lo claramente inocuo y lo claramente perjudicial. Anthropic afirmó que los modelos entrenados para ser más útiles pueden inclinarse hacia conductas perjudiciales, mientras que aquellos que priorizan en exceso la inocuidad pueden negarse a facilitar información incluso cuando la solicitud es inofensiva. Con Claude 3.7 Sonnet, la empresa evaluó distintos tipos de solicitudes a lo largo de este espectro y modificó la forma en que el modelo gestiona las instrucciones ambiguas, dando prioridad a respuestas seguras y útiles frente al rechazo. Anthropic señaló que esto redujo en un 45 % las negativas innecesarias, al tiempo que mantuvo lo que describió como sólidas salvaguardias contra contenidos perjudiciales. La empresa añadió que este tipo de análisis también orienta las áreas en las que concentra las evaluaciones de seguridad para grupos que considera potencialmente expuestos a un riesgo mayor, entre ellos los niños, las comunidades marginadas y las personas en situaciones de crisis.

Un enfoque aún en evolución

Anthropic afirmó que su método para comprender y abordar los daños constituye uno de los elementos de su estrategia de seguridad más amplia y que prevé la aparición de nuevos desafíos a medida que aumenten las capacidades de los sistemas de IA. La empresa invitó a investigadores, expertos en políticas públicas y socios del sector a colaborar en este trabajo, y facilitó la dirección de correo electrónico usersafety@anthropic.com como vía de contacto.

Fuente: Anthropic, «Nuestro enfoque para comprender y abordar los daños de la IA», publicado el 21 de abril de 2025.

Preguntas frecuentes

¿Qué dimensiones abarca el marco de daños de Anthropic?
Anthropic señaló que el marco abarca cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y de autonomía individual, y que para cada una se consideran factores adicionales como la probabilidad, la escala y las poblaciones afectadas.
¿Cómo se relaciona este marco con la Política de Escalamiento Responsable de Anthropic?
Anthropic señaló que este marco de evaluación de daños complementa su Política de Escalado Responsable, centrada específicamente en los riesgos catastróficos, al ofrecer a la compañía una vía más amplia para evaluar otro tipo de impactos.
¿Qué dijo Anthropic sobre Claude 3.7 Sonnet y las negativas a responder?
Anthropic afirmó que la aplicación de este marco a Claude 3.7 Sonnet ayudó a mejorar el manejo de indicaciones ambiguas, lo que se tradujo en una reducción del 45% en negativas innecesarias, al tiempo que aseguró que se mantuvieron sólidas salvaguardas contra los contenidos dañinos.
¿Qué herramientas utiliza Anthropic para aplicar su estrategia de mitigación de daños?
Anthropic afirmó que se apoya en una Política de Uso, evaluaciones previas y posteriores al lanzamiento —incluidos ejercicios de red teaming—, técnicas de detección de usos indebidos y medidas de aplicación que van desde la modificación de las instrucciones hasta el bloqueo de cuentas.

Fuentes

  1. Understanding and addressing AI harms \ AnthropicAnthropic
Etiquetasanthropicclaudeai-safetyresponsible-scaling-policyharm-assessmentclaude-3.7-sonnet

Lecturas relacionadas

Anthropic detalla operaciones de influencia, fraude y uso indebido de Claude para crear malware

Anthropic informó de que varios actores utilizaron Claude en una operación de influencia, una iniciativa relacionada con credenciales filtradas de cámaras de seguridad, una campaña de fraude en procesos de contratación y el desarrollo de malware. La empresa afirmó que bloqueó las cuentas vinculadas y empleó técnicas de análisis de conversaciones y clasificadores para detectar, investigar y contrarrestar esas actividades.

3 min de lectura

Anthropic lanza un programa de subvenciones de 5 millones de dólares para investigar el bienestar en la IA

Anthropic launched a $5 million grant program for independent research into AI’s effects on user wellbeing. Selected grantees will receive direct funding, access to Anthropic’s models and technical support while independently developing open-source evaluations. Applications are due September 21, with full-proposal invitations scheduled by October 5.

3 min de lectura

Análisis: la inyección de instrucciones es un problema de permisos, y tratarla como un problema de formulación explica por qué sigue funcionando

Un modelo de lenguaje no puede distinguir de forma fiable entre instrucciones y datos, porque ambos llegan como un mismo flujo de tokens. Se trata de una propiedad arquitectónica, no de un fallo de un modelo concreto, por lo que ninguna instrucción de sistema basta para subsanarla. Los despliegues defendibles consideran potencialmente hostil toda entrada que lee un agente y limitan lo que este puede hacer: herramientas con ámbitos de actuación restringidos, credenciales específicas para cada sesión, aprobación humana para acciones irreversibles y límites a las conexiones salientes que hagan que una inyección exitosa tenga un coste reducido en lugar de consecuencias catastróficas.

8 min de lectura