Un estudio evalúa cuatro sistemas de revisión de IA en seis modelos de lenguaje, encontrando que OpenAIReview con GPT-5.5 alcanza una precisión del 83.0% al igualar la calidad del artículo con señales externas y detecta el 71.6% de los errores inyectados. La retroalimentación de usuarios reales muestra un sentimiento positivo, con una proporción de votos de 1.44 a 1, aunque los falsos positivos y las pequeñas observaciones siguen siendo comunes.
Evaluación de sistemas de revisión agénticos para investigación asistida por IA
GLM-5.2 supera a GPT-5.5 en la evaluación AA-Briefcase
La nueva evaluación de trabajo del conocimiento agéntico de Artificial Analysis, AA-Briefcase, muestra que GLM-5.2 supera a GPT-5.5 en rendimiento. El benchmark evalúa la ejecución de tareas del mundo real y las capacidades de razonamiento en escenarios de trabajo del conocimiento.
TutorMoments evalúa si los tutores de IA saben cuándo ayudar o contenerse
Los investigadores presentan TutorMoments, un marco diseñado para medir si los modelos de lenguaje grandes pueden equilibrar la compensación pedagógica entre brindar apoyo y fomentar el razonamiento independiente. Basado en transcripciones reales de tutorías matemáticas uno a uno, el sistema reproduce los puntos de decisión para evaluar el comportamiento del modelo frente a una verdad fundamental anotada por humanos.
OpenAI lanza GPT-5.6 con estratificación de modelos y UX de agente; Meta libera Muse Spark 1.1
OpenAI ha lanzado GPT-5.6, introduciendo una nueva escalera de modelos de Luna, Terra y Sol junto con niveles de esfuerzo distintos para los modos Max y Ultra. El lanzamiento trae cambios significativos a la interfaz de ChatGPT Work y Codex, aunque inicialmente enfrentó rechazo de usuarios por una navegación confusa y un agotamiento rápido del uso.
EvoPolicyGym presenta un benchmark para evaluar la evolución autónoma de políticas
Los autores presentan la Evolución Autónoma de Políticas, un entorno de evaluación controlado donde un agente edita repetidamente un sistema de política ejecutable dentro de un presupuesto de interacción fijo para mejorar iterativamente las políticas exploradas.
GPT-5 supera a los humanos en la inducción de estados de creencia mediante planificación
Un nuevo estudio evalúa la capacidad de los Modelos de Lenguaje Grande (LLM) para inducir estados de creencia específicos en otros agentes mediante acciones en lugar de conversación, una capacidad denominada ToM de Planificación No Conversacional (NCP-ToM). Utilizando el marco NCP-ExploreToM, los investigadores probaron seis modelos de vanguardia y participantes humanos en 600 instancias de tareas donde los agentes debían mover objetos o dirigir personajes para lograr objetivos de creencia.