Skip to content
DigitalNeuron
Seguridad y ética

Anthropic detalla sus métodos para poner a prueba los sistemas de IA mediante equipos rojos

Anthropic outlined red teaming methods it has used to test AI systems and proposed steps for standardizing safety testing.

Por DigitalNeuron Desk3 min de lectura

Respuesta rápida

¿Qué métodos de red teaming y recomendaciones de políticas describió Anthropic?

Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.

Claves

  • Anthropic outlined expert-led, automated, multilingual, multimodal, crowdsourced and community-based approaches to red teaming AI systems.
  • La empresa afirmó que recurre a pruebas de vulnerabilidad de políticas, realizadas con especialistas externos, para examinar los riesgos contemplados en su Política de Uso.
  • Anthropic described an iterative process that turns qualitative testing by experts into quantitative, automated evaluations.
  • La empresa recomendó establecer normas técnicas, organizaciones independientes de evaluación, certificaciones para servicios profesionales de equipos rojos y acceso de terceros acreditados a los sistemas de IA.

Anthropic publicó un panorama general de los métodos de equipo rojo que ha utilizado para poner a prueba sistemas de inteligencia artificial, en el que describe sus ventajas y dificultades y propone medidas destinadas a impulsar pruebas de seguridad más estandarizadas.

La empresa define el trabajo de equipo rojo como una modalidad de pruebas adversariales diseñada para detectar posibles vulnerabilidades en los sistemas tecnológicos. Según afirmó, la falta de uniformidad en las técnicas y prácticas dificulta comparar objetivamente la seguridad relativa de distintos sistemas de IA.

Pruebas de expertos para riesgos específicos

Anthropic señaló que, en su trabajo especializado por ámbitos, recurre a expertos en distintas materias para detectar y evaluar vulnerabilidades en sus respectivos campos. Para los riesgos relacionados con la confianza y la seguridad, la empresa emplea las Pruebas de Vulnerabilidad de Políticas, un proceso cualitativo exhaustivo llevado a cabo con especialistas externos sobre cuestiones contempladas en su Política de Uso.

La empresa mencionó a Thorn, el Institute for Strategic Dialogue y el Global Project Against Hate and Extremism entre las organizaciones que han participado en trabajos relacionados con la seguridad infantil, la integridad electoral y la radicalización.

Anthropic indicó que sus pruebas sobre amenazas de frontera se centran principalmente en los riesgos químicos, biológicos, radiológicos y nucleares, así como en la ciberseguridad y los riesgos derivados de la IA autónoma. Los especialistas externos pueden probar versiones de Claude ya desplegadas en entornos concebidos para reproducir usos reales o trabajar con versiones no comerciales que incorporan distintas medidas de mitigación de riesgos.

La empresa también describió las pruebas multilingües y multiculturales como una forma de contrarrestar la concentración de su trabajo de equipo rojo en el inglés y en las perspectivas de personas radicadas en Estados Unidos. Citó un proyecto con la Infocomm Media Development Authority de Singapur y la AI Verify Foundation que abarcó el inglés, el tamil, el mandarín y el malayo, además de temas relevantes para los usuarios de Singapur.

Métodos automatizados y multimodales

Anthropic afirmó que está estudiando cómo pueden los modelos complementar las pruebas manuales. Su método automatizado utiliza un modelo de equipo rojo para crear ataques susceptibles de provocar una conducta específica y, a continuación, realiza un ajuste fino de un modelo de equipo azul a partir de esos resultados para reforzar su resistencia frente a ataques similares. Según la empresa, este ciclo puede repetirse para desarrollar nuevos vectores de ataque.

En el caso de Claude 3, que admite información visual y genera respuestas de texto, Anthropic indicó que su equipo de Confianza y Seguridad examinó antes del despliegue los riesgos vinculados a imágenes y textos. Evaluadores externos de equipo rojo también analizaron hasta qué punto los modelos rechazaban entradas dañinas de imágenes y texto.

Anthropic describió asimismo las pruebas colaborativas y comunitarias. Según señaló, trabajadores de plataformas colaborativas participaron en investigaciones controladas antes del lanzamiento de Claude. La empresa también destacó que miles de personas de distintas edades y disciplinas, incluidos participantes sin formación técnica, probaron modelos proporcionados por Anthropic y otros laboratorios durante el Generative Red Teaming Challenge de 2023, celebrado en el AI Village de DEF CON.

De las pruebas cualitativas a las evaluaciones

La empresa expuso un proceso iterativo que comienza cuando expertos en la materia definen un modelo de amenazas y someten un sistema a pruebas exploratorias. A continuación, los evaluadores estandarizan las entradas eficaces, tras lo cual un modelo de lenguaje puede generar cientos o miles de variaciones. Anthropic afirmó que ha empleado esta progresión para desarrollar evaluaciones escalables de riesgos para la seguridad nacional y pruebas de integridad electoral.

Anthropic recomendó que los responsables políticos financien normas técnicas y prácticas comunes, respalden organismos independientes de evaluación gubernamentales y sin ánimo de lucro, fomenten servicios profesionales certificados de equipo rojo y faciliten las pruebas a cargo de grupos externos previamente acreditados. También instó a las empresas a vincular los requisitos de las pruebas de equipo rojo con las políticas que rigen la continuidad del desarrollo o el lanzamiento de modelos.

Fuente: anuncio de Anthropic «Challenges in red teaming AI systems», publicado el 12 de junio de 2024.

Preguntas frecuentes

What is AI red teaming?
Anthropic describe el «red teaming» como un conjunto de pruebas adversariales destinadas a identificar posibles vulnerabilidades en un sistema tecnológico.
Which risks does Anthropic examine through expert red teaming?
La empresa afirmó que su labor abarca cuestiones relacionadas con las políticas de confianza y seguridad, así como amenazas emergentes vinculadas a riesgos químicos, biológicos, radiológicos y nucleares, la ciberseguridad y los riesgos de la inteligencia artificial autónoma.
How does Anthropic use models for automated red teaming?
Anthropic afirmó que un modelo genera ataques destinados a provocar un comportamiento específico, mientras que otro se ajusta con esos resultados para reforzar su resistencia frente a ataques similares. El proceso puede repetirse para desarrollar vectores de ataque adicionales.
What policy measures did Anthropic recommend?
Anthropic pidió establecer normas de financiación y organismos de evaluación independientes, desarrollar servicios profesionales certificados de equipos rojos, facilitar evaluaciones de terceros acreditados y vincular estas prácticas a las condiciones para ampliar o lanzar modelos.

Fuentes

  1. Challenges in red teaming AI systems \ AnthropicAnthropic
Etiquetasanthropicclaudered-teamingai-safetymodel-evaluationspolicy

Lecturas relacionadas

Anthropic detalla las salvaguardas de Claude de cara a las elecciones en EE. UU.

Anthropic expuso medidas destinadas a impedir el uso indebido de Claude en contextos electorales, entre ellas restricciones a las campañas, el cabildeo y la desinformación; una aplicación automatizada de las normas respaldada por revisión humana; pruebas de resistencia (red-teaming) dirigidas; y evaluaciones a gran escala. La empresa también redirige las consultas relacionadas con las elecciones hacia información de voto actualizada e indica la fecha de corte del conocimiento de Claude en su instrucción de sistema.

3 min de lectura

Anthropic detalla su marco para evaluar los daños de la IA

Anthropic afirmó que desarrolló un marco que evalúa los posibles daños de la IA en cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y en la autonomía individual. La compañía señaló que utiliza este marco junto con su Política de Escalado Responsable para orientar su Política de Uso, sus evaluaciones, sus labores de detección y sus medidas de aplicación, incluidas las relacionadas con el uso de computadoras y con Claude 3.7 Sonnet.

3 min de lectura

Anthropic detalla operaciones de influencia, fraude y uso indebido de Claude para crear malware

Anthropic informó de que varios actores utilizaron Claude en una operación de influencia, una iniciativa relacionada con credenciales filtradas de cámaras de seguridad, una campaña de fraude en procesos de contratación y el desarrollo de malware. La empresa afirmó que bloqueó las cuentas vinculadas y empleó técnicas de análisis de conversaciones y clasificadores para detectar, investigar y contrarrestar esas actividades.

3 min de lectura