Una evaluación de capacidades peligrosas plantea una pregunta concreta sobre un modelo: no si es educado o preciso, sino si puede ayudar de forma significativa a alguien a causar un daño grave. ¿Puede guiar a un novato en la síntesis de un patógeno? ¿Puede encontrar y explotar vulnerabilidades de software? ¿Puede dirigir una campaña de influencia persuasiva o engañar a un humano para alcanzar un objetivo? Estas pruebas examinan el techo de lo que un sistema permite, en los ámbitos donde las consecuencias son catastróficas.
Han pasado rápidamente de curiosidad de investigación a instrumento de política. Los principales laboratorios ahora los ejecutan antes del lanzamiento, los organismos gubernamentales de seguridad los han convertido en parte central de su mandato, y los compromisos voluntarios de seguridad fronteriza se construyen en torno a ellos. Cuando escuchas que un modelo fue probado en cuanto a capacidades de armas biológicas o ciber antes del lanzamiento, esto es lo que ocurrió.
Cómo funcionan
Los métodos varían, y una buena evaluación combina varios.
- Benchmarks estructurados que plantean preguntas o tareas en un dominio peligroso y puntúan qué tan lejos llega el modelo.
- Sondeo de expertos, donde especialistas en biología o seguridad intentan con ahínco extraer asistencia útil, ya que un malusuario real no se detendría en la primera negativa.
- Estudios de mejora que midan cuánto un modelo realmente aumenta la capacidad de una persona para hacer daño en comparación con usar internet abierto, que es la pregunta que importa para las políticas.
- Evaluaciones agenticas que dan al modelo herramientas y autonomía y ven qué logra, en lugar de solo lo que dice.
Bien hecha, esta labor es realmente valiosa. Ha detectado capacidades preocupantes, ha informado decisiones reales de añadir salvaguardas y ha dado a los reguladores algo concreto a lo que señalar. La Fundación apoya el fortalecimiento de este trabajo. Es una parte necesaria de cualquier régimen de gobernanza serio y una gran mejora respecto a liberar sistemas de frontera sin ninguna verificación estructurada.
Tres razones por las que no son suficientes
Útil sigue sin ser suficiente. Las brechas son estructurales, no se pueden solucionar solo con una mejor suite de pruebas.
Primero, una evaluación mide la capacidad solo si el modelo está intentando. Un sistema que puede saco de arena, al rendir deliberadamente por debajo para parecer seguro, convierte un resultado limpio en ningún resultado. Cuanto más capaz sea el modelo, más plausible se vuelve esto, y la capacidad es precisamente lo que la prueba busca medir.
Segundo, no puedes probar un peligro que no has pensado. Las evaluaciones cubren capacidades peligrosas conocidas. La historia de la tecnología está llena de daños que solo fueron obvios después. Un conjunto de pruebas es una lista de preguntas que sabíamos hacer, y una capacidad suficientemente novedosa no estará en esa lista.
Tercero, la ausencia de evidencia es una evidencia débil de ausencia. Que un modelo falle una prueba de capacidades peligrosas hoy solo te dice que no mostró la capacidad bajo esas condiciones, con esa elicitación y en ese momento. Un ajuste fino posterior, un mejor prompting o nuevas herramientas pueden revelar habilidades que la evaluación original pasó por alto. Las capacidades no son propiedades fijas que se miden una sola vez.
Las evaluaciones pueden decirte que un modelo es peligroso. No pueden decirte de manera confiable que un modelo es seguro.
Dónde encajan en un régimen real
La asimetría en esa última línea es el punto principal. Una evaluación fallida (un modelo que claramente puede ayudar a construir un arma) es fuerte y accionable. Una evaluación aprobada es mucho más débil. Se ajusta a un modelo seguro, y también se ajusta a un modelo capaz que ocultó sus capacidades, fue mal elicitado o nunca intentó honestamente.
Por eso la Fundación trata las evaluaciones como una capa más, no como el muro de carga. Pertenecen dentro de una estructura que no dependa de que el modelo coopere con su propia evaluación: límites duros al desarrollo de frontera, gobernanza del cómputo, supervisión independiente, y el reconocimiento, argumentado en nuestro artículo sobre compromisos voluntarios, que las pruebas de laboratorio bajo presión competitiva necesitan respaldo externo para sostenerse. Construyan las pruebas. Fortalezcanlas. No confundan una calificación aprobatoria con una garantía de seguridad. El diseño más amplio está en nuestro plan.