Anthropic detalla su marco para evaluar los daños de la IA
Anthropic afirmó que está compartiendo un marco en evolución que evalúa los daños de la IA en cinco dimensiones, en complemento de su Política de Escalado Responsable.
Respuesta rápida
¿Qué marco anunció Anthropic para evaluar los daños de la IA?
Anthropic afirmó que desarrolló un marco que evalúa los posibles daños de la IA en cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y en la autonomía individual. La compañía señaló que utiliza este marco junto con su Política de Escalado Responsable para orientar su Política de Uso, sus evaluaciones, sus labores de detección y sus medidas de aplicación, incluidas las relacionadas con el uso de computadoras y con Claude 3.7 Sonnet.
Claves
- Anthropic presentó un marco para evaluar los daños de la inteligencia artificial en cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y en la autonomía individual.
- La empresa afirmó que el marco complementa su Política de Escalado Responsable, centrada en los riesgos catastróficos, al abordar una gama más amplia de posibles daños.
- En cuanto a su capacidad de uso del ordenador, Anthropic señaló que había detectado riesgos relacionados con el software financiero y las herramientas de comunicación, y respondió con umbrales de aplicación más estrictos y una técnica de resumen jerárquico.
- Anthropic afirmó que la aplicación del marco a Claude 3.7 Sonnet redujo en un 45 % los rechazos innecesarios, al tiempo que mantuvo las salvaguardas frente a contenidos perjudiciales.
- La empresa describió el enfoque como algo que aún está en evolución e invitó a investigadores externos y expertos en políticas públicas a colaborar.
Anthropic presenta un marco para evaluar daños
Anthropic anunció que está dando a conocer su enfoque, aún en evolución, para evaluar y mitigar diversos daños potenciales derivados de sus sistemas de IA, desde riesgos catastróficos, como las amenazas biológicas, hasta preocupaciones relacionadas con la seguridad infantil, la desinformación y el fraude.
La empresa señaló que el marco complementa su Política de Escalado Responsable, centrada específicamente en los riesgos catastróficos, al adoptar una perspectiva más amplia sobre otros tipos de repercusiones. Anthropic indicó que el enfoque sigue evolucionando y que comparte sus planteamientos actuales, que continuará desarrollando.
Cinco dimensiones del daño
Anthropic afirmó que evalúa las posibles repercusiones en cinco dimensiones básicas:
- Repercusiones físicas: efectos sobre la salud y el bienestar corporal
- Repercusiones psicológicas: efectos sobre la salud mental y el funcionamiento cognitivo
- Repercusiones económicas: consecuencias financieras y consideraciones patrimoniales
- Repercusiones sociales: efectos sobre las comunidades, las instituciones y los sistemas compartidos
- Repercusiones sobre la autonomía individual: efectos sobre la toma de decisiones y las libertades personales
Para cada dimensión, la empresa indicó que considera factores como la probabilidad, la magnitud, las poblaciones afectadas, la duración, la causalidad, la contribución de la tecnología al daño y la viabilidad de mitigarlo.
Anthropic señaló que gestiona los riesgos detectados mediante el marco con una combinación de medidas: una Política de Uso; evaluaciones como ejercicios de equipo rojo y pruebas adversariales realizadas antes y después del lanzamiento; técnicas de detección destinadas a identificar usos indebidos; y medidas de cumplimiento que abarcan desde modificaciones de las instrucciones hasta el bloqueo de cuentas.
Ejemplos citados
Anthropic expuso dos ejemplos de cómo aplicó el marco.
En el caso de su función de uso de computadoras, que permite a los modelos interactuar con interfaces informáticas, la empresa explicó que examinó los riesgos asociados a programas financieros y plataformas bancarias, donde la automatización no autorizada podría facilitar el fraude o la manipulación, así como a herramientas de comunicación que podrían emplearse en operaciones de influencia dirigidas o campañas de suplantación de identidad. Anthropic señaló que este análisis la llevó a establecer umbrales de cumplimiento más estrictos y a utilizar la síntesis jerárquica, un método que, según la empresa, permite detectar daños sin renunciar a sus estándares de privacidad.
La empresa también describió su trabajo sobre lo que denominó límites de respuesta de los modelos, relativo a cómo estos gestionan solicitudes situadas entre lo claramente inocuo y lo claramente perjudicial. Anthropic afirmó que los modelos entrenados para ser más útiles pueden inclinarse hacia conductas perjudiciales, mientras que aquellos que priorizan en exceso la inocuidad pueden negarse a facilitar información incluso cuando la solicitud es inofensiva. Con Claude 3.7 Sonnet, la empresa evaluó distintos tipos de solicitudes a lo largo de este espectro y modificó la forma en que el modelo gestiona las instrucciones ambiguas, dando prioridad a respuestas seguras y útiles frente al rechazo. Anthropic señaló que esto redujo en un 45 % las negativas innecesarias, al tiempo que mantuvo lo que describió como sólidas salvaguardias contra contenidos perjudiciales. La empresa añadió que este tipo de análisis también orienta las áreas en las que concentra las evaluaciones de seguridad para grupos que considera potencialmente expuestos a un riesgo mayor, entre ellos los niños, las comunidades marginadas y las personas en situaciones de crisis.
Un enfoque aún en evolución
Anthropic afirmó que su método para comprender y abordar los daños constituye uno de los elementos de su estrategia de seguridad más amplia y que prevé la aparición de nuevos desafíos a medida que aumenten las capacidades de los sistemas de IA. La empresa invitó a investigadores, expertos en políticas públicas y socios del sector a colaborar en este trabajo, y facilitó la dirección de correo electrónico usersafety@anthropic.com como vía de contacto.
Fuente: Anthropic, «Nuestro enfoque para comprender y abordar los daños de la IA», publicado el 21 de abril de 2025.
Preguntas frecuentes
- ¿Qué dimensiones abarca el marco de daños de Anthropic?
- Anthropic señaló que el marco abarca cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y de autonomía individual, y que para cada una se consideran factores adicionales como la probabilidad, la escala y las poblaciones afectadas.
- ¿Cómo se relaciona este marco con la Política de Escalamiento Responsable de Anthropic?
- Anthropic señaló que este marco de evaluación de daños complementa su Política de Escalado Responsable, centrada específicamente en los riesgos catastróficos, al ofrecer a la compañía una vía más amplia para evaluar otro tipo de impactos.
- ¿Qué dijo Anthropic sobre Claude 3.7 Sonnet y las negativas a responder?
- Anthropic afirmó que la aplicación de este marco a Claude 3.7 Sonnet ayudó a mejorar el manejo de indicaciones ambiguas, lo que se tradujo en una reducción del 45% en negativas innecesarias, al tiempo que aseguró que se mantuvieron sólidas salvaguardas contra los contenidos dañinos.
- ¿Qué herramientas utiliza Anthropic para aplicar su estrategia de mitigación de daños?
- Anthropic afirmó que se apoya en una Política de Uso, evaluaciones previas y posteriores al lanzamiento —incluidos ejercicios de red teaming—, técnicas de detección de usos indebidos y medidas de aplicación que van desde la modificación de las instrucciones hasta el bloqueo de cuentas.