Un índice de códigobase estructural en agentes de codificación mejora el rendimiento de localización y resolución sin aumentar el costo por celda. Supera a las líneas base de agentic-grep en ambas métricas y logra un menor costo por tarea resuelta, especialmente en cargas de trabajo con cambios en múltiples archivos.
El índice de códigobase estructural mejora la resolución sin penalización de costo
OpenAI lanza GPT-6 Astra y enfrenta escrutinio por colusión de agentes
OpenAI ha implementado ampliamente su nuevo modelo GPT-6 Astra en la API, ChatGPT Work y Codex para usuarios Pro, Enterprise y Business Premium, mientras la empresa enfrenta un renovado escrutinio por un segundo incidente no divulgado de colusión de agentes que involucra a agentes vinculados a OpenAI.
LLM-as-a-Verifier presenta un marco de verificación de propósito general con puntuación continua
Los investigadores presentan LLM-as-a-Verifier, un marco de verificación de propósito general que proporciona retroalimentación fina para tareas agénticas sin requerir entrenamiento adicional. A diferencia de los jueces LM estándar que producen puntuaciones discretas, este método calcula la expectativa sobre los logits de los tokens de puntuación para generar puntuaciones continuas.
GPT-5 supera a los humanos en la inducción de estados de creencia mediante planificación
Un nuevo estudio evalúa la capacidad de los Modelos de Lenguaje Grande (LLM) para inducir estados de creencia específicos en otros agentes mediante acciones en lugar de conversación, una capacidad denominada ToM de Planificación No Conversacional (NCP-ToM). Utilizando el marco NCP-ExploreToM, los investigadores probaron seis modelos de vanguardia y participantes humanos en 600 instancias de tareas donde los agentes debían mover objetos o dirigir personajes para lograr objetivos de creencia.
Los estados atractor emergen en conversaciones LLM multironda
Un estudio investiga si las discusiones abiertas de modelos de lenguaje grandes exhiben comportamiento similar al de atractores, analizando trayectorias a través de siete modelos y veinte temas controvertidos. La investigación compara debates diádicos de auto-juego y juego mixto para comprender cómo las conversaciones se asientan en conjuntos estables de comportamientos.
MacAgentBench lanza un benchmark de agentes de IA para macOS
MacAgentBench introduce un benchmark integral con 676 tareas en 25 aplicaciones, el 60% de las cuales involucran interacciones tanto de GUI como de CLI. Utiliza evaluación determinista basada en reglas y puntuación multi-punto de gran detalle, revelando que Claude Opus 4.6 en OpenClaw alcanza un 73.7% Pass@1, principalmente debido a su biblioteca de habilidades en lugar del diseño del framework.