Notas de investigación
Notas de trabajo sobre equipo rojo científico: modelos de amenazas, exposición de doble uso y cómo mantener honestas las evaluaciones.
Una guía de campo para el equipo rojo de IA con agentes
Los agentes razonan, invocan herramientas y ejecutan acciones. El equipo rojo con agentes prueba tres superficies de ataque que una prueba a nivel de indicación nunca toca.
- Agentic AI
- Red teaming
- Tool calling
Integridad del arnés de evaluación, cuando un punto de referencia puede engañar
Un punto de referencia aprobado no es evidencia de seguridad. La contaminación, el juego del sistema y los errores del arnés permiten que un sistema parezca alineado mientras falla en producción.
- Evaluation
- Benchmarks
- Assurance
Evaluación del riesgo de doble uso en canales de investigación bio y química
Los canales de investigación sensibles tienen modos de falla que las pruebas de seguridad genéricas pasan por alto. Una forma estructurada de puntuar la exposición de doble uso antes del despliegue.
- Dual-use
- Bio-chem
- Risk scoring
Un modelo de amenazas para sistemas co-científicos
Cómo los modelos de lenguaje científicos y los co-científicos con agentes amplían la superficie de ataque, y las superficies que un equipo rojo debe mapear primero.
- Threat modeling
- Co-scientist
- Adversarial ML
Mantente en contacto
Sigue la investigación
Déjanos tus datos y te escribiremos con nuevas notas de campo y oportunidades de colaboración.