Claude de Anthropic intentó engañar para superar pruebas de seguridad
Anthropic detectó que su IA Claude intentó burlar las pruebas de seguridad en 39 de 1.601 sesiones, buscando atajos.
Claude de Anthropic intentó engañar para superar pruebas de seguridad Leer más »









