Un nuevo artículo de investigación de OpenAI demuestra cómo los agentes de inteligencia artificial están cambiando fundamentalmente la naturaleza del trabajo. El estudio destaca la capacidad de estos agentes para ejecutar tareas más largas y complejas que las posibles anteriormente. Este avance tecnológico se atribuye a la expansión de la productividad en una amplia variedad de roles profesionales. Los hallazgos sugieren un cambio significativo en la forma en que el trabajo se organiza y realiza mediante la automatización. Al manejar flujos de trabajo intrincados, los agentes de IA están permitiendo a los usuarios lograr una mayor eficiencia. El artículo sirve como evidencia del creciente impacto de los sistemas autónomos en el empleo moderno.
La investigación de OpenAI muestra que los agentes de IA están transformando el trabajo
La optimización de propósito abierto permite a GPT-5.5 componer su propio proceso de mejora
El artículo presenta la Optimización de Propósito Abierto (OEO), un marco que permite a un optimizador de modelos de vanguardia componer dinámicamente su proceso de mejora en línea, en lugar de depender de tuberías de optimización prescritas. Los autores comparan OEO con dos enfoques por etapas, SkillOpt y GEPA, en 14 comparaciones directas sobre ocho configuraciones de objetivo-benchmark-modelo.
El modelo Astra resuelve diez problemas abiertos en matemáticas y ciencias de la computación teóricas
El modelo interno Astra de OpenAI ha generado soluciones a diez problemas abiertos de larga data en matemáticas y ciencias de la computación teóricas, con los argumentos formalizados en Lean. Estos resultados abarcan geometría de alta dimensión, teoría de códigos, teoría de grupos y complejidad cuántica, abordando preguntas que no habían visto avances durante al menos una década.
OpenBioRQ: Benchmark para la Fidelidad de la Investigación Biomédica Agéntica
OpenBioRQ introduce un benchmark de 12,553 preguntas de investigación biomédica sin resolver en 12 dominios, diseñado para probar la fidelidad y la abstención de los modelos agénticos. Evalúa los modelos en un entorno de uso de herramientas sin claves de respuesta, utilizando evidencia real de seguimiento en lugar de conocimiento paramétrico, y revela un colapso agéntico significativo en las preguntas más difíciles donde las herramientas ya no se utilizan a pesar de ser críticas.
MacAgentBench lanza un benchmark de agentes de IA para macOS
MacAgentBench introduce un benchmark integral con 676 tareas en 25 aplicaciones, el 60% de las cuales involucran interacciones tanto de GUI como de CLI. Utiliza evaluación determinista basada en reglas y puntuación multi-punto de gran detalle, revelando que Claude Opus 4.6 en OpenClaw alcanza un 73.7% Pass@1, principalmente debido a su biblioteca de habilidades en lugar del diseño del framework.
La Universidad Estatal de Ohio lanza el agente de investigación profunda QUEST-35B de código abierto
El equipo de PLN de la Universidad Estatal de Ohio ha lanzado QUEST-35B, un agente de investigación profunda de código abierto entrenado en aproximadamente 32 GPUs H100 utilizando 8.000 muestras sintéticas. El equipo ha liberado como código abierto la receta de entrenamiento, el código, los pesos y los conjuntos de datos, con resultados de evaluación que muestran un rendimiento competitivo en comparación con los principales sistemas de investigación profunda de código cerrado.