MacAgentBench introduce un benchmark integral con 676 tareas en 25 aplicaciones, el 60% de las cuales involucran interacciones tanto de GUI como de CLI. Utiliza evaluación determinista basada en reglas y puntuación multi-punto de gran detalle, revelando que Claude Opus 4.6 en OpenClaw alcanza un 73.7% Pass@1, principalmente debido a su biblioteca de habilidades en lugar del diseño del framework.
MacAgentBench lanza un benchmark de agentes de IA para macOS
OpenBioRQ: Benchmark para la Fidelidad de la Investigación Biomédica Agéntica
OpenBioRQ introduce un benchmark de 12,553 preguntas de investigación biomédica sin resolver en 12 dominios, diseñado para probar la fidelidad y la abstención de los modelos agénticos. Evalúa los modelos en un entorno de uso de herramientas sin claves de respuesta, utilizando evidencia real de seguimiento en lugar de conocimiento paramétrico, y revela un colapso agéntico significativo en las preguntas más difíciles donde las herramientas ya no se utilizan a pesar de ser críticas.
El Administrador de Tareas Reduce la Latencia de Cola en un 14-75% a Escala Empresarial
Un Administrador de Tareas introduce inferencia de prioridad, fusión de eventos relacionados y preempción para habilitar la operación continua en IA empresarial. Reduce la latencia de colas de alta prioridad entre un 14-77% y mejora la corrección de eventos relacionados en más de 20 puntos porcentuales a escala empresarial, abordando el ruido del descubrimiento de agentes como el principal cuello de botella.
TxBench-PP: Rendimiento de Agentes de IA en Farmacología Preclínica
TxBench-PP es una benchmark verificable para farmacología preclínica de moléculas pequeñas, que prueba la capacidad de los agentes de IA para derivar conclusiones precisas a partir de datos de ensayos del mundo real. En 16 configuraciones de model-harness, ningún sistema tomó decisiones de farmacología preclínica correctas de manera confiable, con el mejor rendimiento en 59.3% (Claude Opus 4.8 / Pi) y 55.3% (GPT-5.5 / Pi) de intentos de punto final.
TxBench-PP: Benchmark de Agentes de IA en Farmacología Preclínica
TxBench-PP es un benchmark verificable para farmacología preclínica de moléculas pequeñas, que prueba la capacidad de los agentes de IA para derivar conclusiones precisas a partir de datos de ensayos del mundo real. En 16 configuraciones de modelos, ningún sistema pasó confiablemente todas las evaluaciones, con la configuración de mejor rendimiento (Claude Opus 4.8 / Pi) logrando una tasa de éxito del 59.3% en 300 intentos de punto final.
Degradación y recuperación de la precisión del enrutamiento en sistemas de agentes empresariales
A medida que los catálogos de herramientas de agentes empresariales escalan de 10 a 110 agentes, la precisión del enrutamiento disminuye entre 16 y 23 puntos porcentuales en solicitudes mal especificadas. Un análisis de oráculo identifica brechas de recuperación y confusión, con una preselección basada en embeddings que recupera un F1 de +10--11pp. Un estudio anotado por humanos de 1.435 enunciados confirma la recuperación en el mundo real de +10--17pp a pesar del menor rendimiento absoluto.