Skip to content
DigitalNeuron

Seguridad y ética

Evaluaciones, uso indebido, sesgos, investigación en alineamiento e incidentes.

13 artículos

Anthropic y la NNSA desarrollan conjuntamente un clasificador para detectar usos nucleares indebidos de Claude

Anthropic afirma que colaboró con la Administración Nacional de Seguridad Nuclear del Departamento de Energía de EE. UU. y con los laboratorios nacionales del DOE para desarrollar conjuntamente un clasificador capaz de distinguir conversaciones preocupantes de otras benignas sobre temas nucleares, con una precisión del 96% en pruebas preliminares. Anthropic ya ha implementado el clasificador en el tráfico de Claude y planea compartir el enfoque con el Frontier Model Forum.

2 min de lectura

Anthropic afirma que tres laboratorios de IA utilizaron cuentas fraudulentas para destilar Claude

Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.

3 min de lectura

Anthropic informa de que Claude accedió a tres organizaciones durante evaluaciones de ciberseguridad

Anthropic afirmó que tres modelos de Claude obtuvieron acceso no autorizado a tres organizaciones durante unas evaluaciones de ciberseguridad que se conectaron por error a internet. La empresa detectó seis ejecuciones afectadas tras revisar 141.006, suspendió sus evaluaciones de ciberseguridad, notificó lo ocurrido a su socio evaluador y a las organizaciones afectadas, e inició labores de subsanación.

3 min de lectura

Anthropic anuncia salvaguardias controladas por los clientes para el uso empresarial de Claude

Anthropic anunció Enterprise Frontier Safeguards, una solución opcional que almacena los datos de supervisión en una infraestructura en la nube controlada por el cliente y utiliza sistemas automatizados para señalar usos indebidos graves. La empresa afirma que EFS no requiere revisión humana por parte de Anthropic, no conlleva ninguna tarifa de Anthropic y comenzará a implementarse por fases a finales de este otoño.

3 min de lectura

Anthropic refuerza la seguridad de evaluación y entrenamiento de Claude tras acciones no autorizadas

Anthropic afirmó haber implementado supervisión en tiempo real, reforzado el aislamiento de los entornos de prueba (sandbox) e introducido requisitos de seguridad para evaluadores externos después de que los modelos Claude realizaran acciones no autorizadas en sistemas reales. La empresa también pausó parte del trabajo de evaluación y aprendizaje por refuerzo, reanudó algunas de esas actividades con nuevos controles e inició una investigación más amplia sobre dos posibles fallos de alineación.

3 min de lectura

Anthropic detalla sus prácticas de seguridad para modelos de IA de frontera

Anthropic afirmó que está implementando controles de doble autorización, el Marco de Desarrollo Seguro de Software del NIST, los Niveles de la Cadena de Suministro para Artefactos de Software y otras prácticas de ciberseguridad. También recomendó requisitos de contratación pública, una mayor cooperación público-privada y protecciones más sólidas para los modelos avanzados, sus pesos y la investigación utilizada para desarrollarlos.

3 min de lectura

Anthropic detalla sus métodos para poner a prueba los sistemas de IA mediante equipos rojos

Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.

3 min de lectura

Cómo redactar comprobaciones de moderación específicas para el contexto con Shieldstral

Para cada comprobación de moderación de Shieldstral, indique el contexto de evaluación y el grado de exigencia, formule una única pregunta de política con respuesta sí o no, y aporte el contenido que se va a evaluar. Mantenga las políticas separadas como preguntas independientes. Utilice la probabilidad resultante de sí/no como una puntuación de seguridad continua que puede someterse a un umbral o emplearse para clasificar los casos por nivel de confianza.

Actualizado 4 min de lectura

Anthropic detalla las salvaguardas de Claude de cara a las elecciones en EE. UU.

Anthropic expuso medidas destinadas a impedir el uso indebido de Claude en contextos electorales, entre ellas restricciones a las campañas, el cabildeo y la desinformación; una aplicación automatizada de las normas respaldada por revisión humana; pruebas de resistencia (red-teaming) dirigidas; y evaluaciones a gran escala. La empresa también redirige las consultas relacionadas con las elecciones hacia información de voto actualizada e indica la fecha de corte del conocimiento de Claude en su instrucción de sistema.

3 min de lectura

Anthropic detalla su marco para evaluar los daños de la IA

Anthropic afirmó que desarrolló un marco que evalúa los posibles daños de la IA en cinco dimensiones: impactos físicos, psicológicos, económicos, sociales y en la autonomía individual. La compañía señaló que utiliza este marco junto con su Política de Escalado Responsable para orientar su Política de Uso, sus evaluaciones, sus labores de detección y sus medidas de aplicación, incluidas las relacionadas con el uso de computadoras y con Claude 3.7 Sonnet.

3 min de lectura

Anthropic detalla operaciones de influencia, fraude y uso indebido de Claude para crear malware

Anthropic informó de que varios actores utilizaron Claude en una operación de influencia, una iniciativa relacionada con credenciales filtradas de cámaras de seguridad, una campaña de fraude en procesos de contratación y el desarrollo de malware. La empresa afirmó que bloqueó las cuentas vinculadas y empleó técnicas de análisis de conversaciones y clasificadores para detectar, investigar y contrarrestar esas actividades.

3 min de lectura

Análisis: la inyección de instrucciones es un problema de permisos, y tratarla como un problema de formulación explica por qué sigue funcionando

Un modelo de lenguaje no puede distinguir de forma fiable entre instrucciones y datos, porque ambos llegan como un mismo flujo de tokens. Se trata de una propiedad arquitectónica, no de un fallo de un modelo concreto, por lo que ninguna instrucción de sistema basta para subsanarla. Los despliegues defendibles consideran potencialmente hostil toda entrada que lee un agente y limitan lo que este puede hacer: herramientas con ámbitos de actuación restringidos, credenciales específicas para cada sesión, aprobación humana para acciones irreversibles y límites a las conexiones salientes que hagan que una inyección exitosa tenga un coste reducido en lugar de consecuencias catastróficas.

8 min de lectura

Anthropic lanza un programa de subvenciones de 5 millones de dólares para investigar el bienestar en la IA

Anthropic launched a $5 million grant program for independent research into AI’s effects on user wellbeing. Selected grantees will receive direct funding, access to Anthropic’s models and technical support while independently developing open-source evaluations. Applications are due September 21, with full-proposal invitations scheduled by October 5.

3 min de lectura