Juanma Aranda

HERRAMIENTAS

Artificial Analysis añade reporte de rechazos por seguridad a su índice de agentes de código

Artificial Analysis incorporó el 18 de septiembre un indicador de “rechazos por seguridad” a su Coding Agent Index. La métrica separa intentos bloqueados de los que se recuperan con fallback y cuantifica su impacto en la puntuación. Para comparar agentes, ahora puede verse junto a capacidad, coste, tokens y tiempo, especialmente en tareas con componentes de seguridad.

Audio con ElevenLabs

Qué ha ocurrido

Artificial Analysis ha añadido el 18 de septiembre un reporte de rechazos por seguridad a su Coding Agent Index, que muestra la frecuencia con la que un proveedor o modelo rehúsa iniciar o continuar una tarea. Distingue entre intentos bloqueados (terminan con error del proveedor o negativa del modelo y puntúan 0; los errores de proveedor se reintentan hasta 10 veces) y fallbacks (el agente se recupera cambiando o continuando el modelo y la tarea se puntúa con normalidad). La tasa se calcula sobre intentos retenidos y se pondera igual que el índice; un 2% de bloqueos podría costar como máximo dos puntos.

Qué significa para creadores

Si dependes de agentes de código para tareas técnicas (p. ej., uso de terminal o consultas sobre repositorios), este gráfico te deja ver la fiabilidad operativa cuando las salvaguardas se activan. Dos agentes con puntuaciones globales similares pueden comportarse distinto cerca de límites de política: uno se detiene, otro cambia de modelo y sigue. Prioriza una tasa de bloqueos baja o un buen fallback según tu tolerancia al riesgo en revisiones de seguridad o administración de sistemas. Ten en cuenta que el coste mostrado es solo API por token y que el tiempo activo no incluye arranque ni verificador/juez, por lo que el gasto y la latencia reales en producción pueden ser mayores. La métrica no juzga si la política del proveedor es adecuada: interpreta si una tasa baja implica más utilidad, salvaguardas más laxas o un arnés que gestiona mejor las restricciones.

Fuente y contexto

La novedad llega junto a la versión 1.5 del benchmark de agentes de código y se suma a los informes de rendimiento, consumo de tokens, coste de API, tiempo de ejecución y reward hacking. El índice combina 303 tareas de DeepSWE v1.1, Terminal-Bench 4.0 y SWE-Atlas-QnA, con tres intentos por tarea y ponderación igual entre benchmarks. Artificial Analysis, fundada por Micah Hill-Smith (CEO) y George Cameron (CPO), orienta su producto a diagnosticar fallos y planea comparar arneses de agente. Sus cifras de escala son auto-reportadas y ha hecho público un listado de respaldos conocidos.