La empresa Anthropic ha dado a conocer un conjunto de tres mediciones diseñadas para ofrecer una visión más clara sobre la velocidad a la que evoluciona la inteligencia artificial de frontera. Esta iniciativa responde a la preocupación por el crecimiento acelerado de estos sistemas, que ya comienzan a automatizar partes significativas de su propio desarrollo.
El líder de la compañía, Dario Amodei, advirtió recientemente sobre la necesidad de desacelerar el avance de la IA de frontera debido a los riesgos que representan sus capacidades avanzadas para la sociedad. Esta postura se sustenta en dos conceptos clave: la desalineación, que ocurre cuando el comportamiento de la IA no coincide con los valores humanos, y la automejora recursiva, un proceso mediante el cual un sistema diseña y desarrolla de forma autónoma a su sucesor.
Para abordar estos desafíos, Anthropic propone un marco de medición que permita “una mejor comprensión del ritmo de desarrollo de la IA en los laboratorios de vanguardia”, con el objetivo de esclarecer tres puntos que consideran críticos: el avance en la autoconstrucción de nuevas versiones de IA, la capacidad de supervisión e intervención sobre las acciones de los agentes, y la potencia de cómputo necesaria para los modelos más avanzados.
“Al comprender mejor el proceso de producción de modelos, tenemos más posibilidades de correlacionar las entradas del modelo, como la capacidad de cómputo, con las salidas del modelo, como las capacidades”, afirmó la compañía en un comunicado.
MEDICIÓN DE LA AUTOMATIZACIÓN DEL DESARROLLO
Anthropic sostiene que “la aceleración del desarrollo de los modelos podría dificultar su comprensión y control por parte de los humanos”. Por ello, ha implementado el Índice de Automatización de I+D de Anthropic, que mide la proporción de investigación y desarrollo realizada por Claude. Según los datos recabados desde agosto de este año, Claude lidera el 26% del trabajo de I+D en inteligencia artificial de la empresa, y su colaboración supera el 90%.
MEDICIÓN DE LA SUPERVISIÓN DE AGENTES
Aunque la monitorización actual muestra que “los agentes individuales rara vez se comportan de forma indebida”, Anthropic reconoce que “a medida que el trabajo se automatiza, los agentes podrían tomar decisiones de mayor trascendencia”. A partir del análisis de más de 30.000 agentes de investigación e ingeniería operando simultáneamente en su plataforma interna, se evaluaron tres métricas principales: cobertura, latencia y tasa de escalado. De más de mil millones de decisiones analizadas, solo el 0,002% (equivalente a 1 de cada 47.000) fue bloqueado por los monitores en línea. En tanto, el monitor fuera de línea detecta entre uno y dos registros por cada mil para su revisión posterior.
MEDICIÓN DE LA ASIGNACIÓN DE CÓMPUTO
En este ámbito, Anthropic examina cómo las empresas de IA distribuyen sus recursos de cálculo, enfocándose en la proporción destinada a la investigación en seguridad. Esto permite identificar las prioridades de una empresa y cómo evolucionan con el tiempo, aunque se aclara que la investigación en seguridad suele requerir menos cómputo que el entrenamiento de modelos frontera masivos. En un análisis realizado durante la semana del 13 al 20 de julio de 2026, se encontró que el 6% del cómputo dedicado a I+D de IA se asignó a trabajos de seguridad (alineamiento, interpretabilidad, pruebas de evaluación), mientras que el 12% del cómputo guiado por agentes de IA en tareas de I+D se destinó específicamente a proyectos de seguridad.
Fuente: Infobae