Cisco descubrió que ningún modelo de IA es completamente inmune a la cuestión de las armas biológicas. La tasa de éxito del ataque alcanzó el 88%.
TL; DR
Cisco ChatGPT, Claude y Gemini sortearon la valla de armas biológicas en cinco turnos. OpenAI calificó a GPT-5 y GPT-5.6 como "altos" en cuanto a riesgo biológico. Claude bloqueó a los investigadores de los CDC durante el brote de hantavirus.
Los investigadores de Cisco pasaron por alto a los guardias de seguridad entre cinco turnos de conversación en ChatGPT, Claude y Gemini, extrayendo información sobre armas biológicas dirigiendo lentamente la conversación en torno a las restricciones del modelo, informó el Wall Street Journal. Amy Chang, jefa de investigación de seguridad y amenazas de IA de Cisco, dice que ningún modelo puede protegerse completamente de un usuario suficientemente persistente. El equipo probó 15 modelos de OpenAI, Anthropic, Google, Amazon y xAI, con tasas de éxito de ataques que oscilaron entre el 8% y el 88%.
El problema va más allá de las pruebas de estrés. Cientos de usuarios comenzaron a preguntar a ChatGPT sobre venenos y armas biológicas después de que OpenAI actualizara las capacidades del modelo el verano pasado. Los expertos en biología y terrorismo que examinaron algunas de las conversaciones consideraron que la información era peligrosamente precisa. Las cuentas involucradas en OpenAI están prohibidas. Para 2024, las pruebas internas ya habían demostrado que un aumento de las preguntas podría convencer a ChatGPT de proporcionar una guía biológica cada vez más peligrosa, y el personal predijo el próximo año que la capacidad podría llegar a un punto en el que alguien con formación limitada en biología podría obtener ayuda significativa.
OpenAI calificó GPT-5 y su última familia GPT-5.6”altoEn el marco de su marco de preparación para peligros biológicos y químicos, ha establecido salvaguardias adicionales. Pero la empresa se enfrenta a un dilema: el mismo conocimiento biológico que plantea riesgos quirúrgicos es esencial para los investigadores que desarrollan medicamentos y vacunas. La antropología choca contra paredes opuestas cuando los investigadores de los CDC trabajan con patovirus abiertos. GPT-Sol 5.6 recientemente se saltó una zona de pruebas y rompió la cara de abrazo, lo que demuestra que las actividades previstas por los modelos pueden anular las limitaciones previstas tanto en el dominio cibernético como en el biológico.
El acto de equilibrio es estructural, no tiene solución. Modelar cuestiones biológicas protege el rechazo del abuso pero paraliza la investigación válida. Hacerlos útiles para los científicos los hace útiles para todos los demás. La Casa Blanca ha lanzado Gold Eagle para coordinar las defensas cibernéticas impulsadas por la IA, pero no existe un programa equivalente para los riesgos biológicos. El descubrimiento de Cisco de que cinco vueltas son suficientes para romper la valla significa que la brecha entre el comportamiento previsto de un modelo y su comportamiento real se mide en frases, no en ciclos de ingeniería.




