La nueva evaluación de trabajo del conocimiento agéntico de Artificial Analysis, AA-Briefcase, muestra que GLM-5.2 supera a GPT-5.5 en rendimiento. El benchmark evalúa la ejecución de tareas del mundo real y las capacidades de razonamiento en escenarios de trabajo del conocimiento.
GLM-5.2 supera a GPT-5.5 en la evaluación AA-Briefcase
Los ingresos de Neocloud de SpaceX alcanzan los 28 mil millones de dólares anuales en medio de actualizaciones de OpenAI y Sakana
SpaceX ha asegurado su tercer acuerdo de alquiler de GPU con Reflection AI, elevando sus ingresos anualizados a aproximadamente 28 mil millones de dólares, basado en una tasa calculada de más de 10 dólares por hora para las GPUs Blackwell. Esta valoración es aproximadamente el doble que la de Coreweave, destacando el rápido crecimiento y el alto poder de fijación de precios en el mercado de infraestructura de IA.
OpenAI expande Daybreak, Sakana lanza Fugu y GLM-5.2 gana tracción
Las noticias de IA de esta semana destacan la expansión de las iniciativas de ciberseguridad de OpenAI, el lanzamiento por parte de Sakana AI de un modelo de orquestación llamado Fugu y la creciente adopción del modelo de pesos abiertos GLM-5.2.
Evaluación de sistemas de revisión agénticos para investigación asistida por IA
Un estudio evalúa cuatro sistemas de revisión de IA en seis modelos de lenguaje, encontrando que OpenAIReview con GPT-5.5 alcanza una precisión del 83.0% al igualar la calidad del artículo con señales externas y detecta el 71.6% de los errores inyectados. La retroalimentación de usuarios reales muestra un sentimiento positivo, con una proporción de votos de 1.44 a 1, aunque los falsos positivos y las pequeñas observaciones siguen siendo comunes.
Z.ai lanza GLM-5.3 con programación mejorada mediante postentrenamiento extendido
Z.ai ha lanzado el modelo GLM-5.3, que demuestra capacidades mejoradas en codificación compleja y tareas de largo alcance. Las mejoras se atribuyen completamente a los mayores esfuerzos de postentrenamiento que involucran más entornos, tareas diversas y cómputo adicional.
TutorMoments evalúa si los tutores de IA saben cuándo ayudar o contenerse
Los investigadores presentan TutorMoments, un marco diseñado para medir si los modelos de lenguaje grandes pueden equilibrar la compensación pedagógica entre brindar apoyo y fomentar el razonamiento independiente. Basado en transcripciones reales de tutorías matemáticas uno a uno, el sistema reproduce los puntos de decisión para evaluar el comportamiento del modelo frente a una verdad fundamental anotada por humanos.