Research paper
arxiv arXiv cs.AI · ahora mismo En vivo

GPT-5 y GPT-5 Nano igualan a expertos en la evaluación de investigaciones sobre oncogénesis microbiana

Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.

arxiv arXiv cs.CL · hace 2 h

GPT-5 y GPT-5 Nano igualan a expertos en la extracción de evidencia sobre oncogénesis microbiana

Un estudio que evalúa modelos de lenguaje grandes en la síntesis sistemática de evidencia para la oncogénesis microbiana encontró que GPT-5 y GPT-5 Nano se desempeñan de manera indistinguible de los expertos del dominio. Los investigadores evaluaron Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 y GPT-5 Nano en 24 artículos de investigación utilizando una plantilla estructurada de 77 elementos a través de múltiples tipos de preguntas.

arxiv arXiv cs.LG · hace 3 d

U-OPSD permite la auto-distilación no supervisada en política para LLM

Los investigadores proponen la Auto-Distilación No Supervisada en Política (U-OPSD), un método que logra una mejora post-entrenamiento para modelos de lenguaje grandes utilizando únicamente las propias generaciones del modelo sin supervisión externa. El enfoque muestrea múltiples trayectorias para construir una pseudo-solución mediante votación mayoritaria, luego destila una distribución docente en los prefijos de la finalización incorrecta más larga del modelo.

arxiv arXiv cs.CL · hace 3 d · 4 vistas

M$^3$R-Bench presenta un benchmark fundamentado en evidencia para la comprensión de metáforas multimodales

Los investigadores presentan M$^3$R-Bench, un benchmark unificado que contiene 1.000 instancias de imagen-texto con anotaciones verificadas por humanos diseñadas para evaluar la comprensión de metáforas multimodales fundamentadas en evidencia. El benchmark proporciona anotaciones conjuntas para la ocurrencia de metáforas, el mapeo Objetivo-Fuente, el sentimiento y explicaciones por etapas basadas en la Teoría de las Metáforas Conceptuales.

lab Google DeepMind Blog · hace 4 d · 16 vistas

Google DeepMind abre el código fuente del modelo de IA WeatherNext para la predicción de ciclones

Google DeepMind y Google Research han abierto el código fuente de los modelos de IA WeatherNext 2 y WeatherNext Cyclones, que lograron una precisión de última generación en la predicción de trayectorias, intensidad y estructura del viento de ciclones tropicales. Publicado en Nature, el trabajo demuestra que estos modelos proporcionan a los pronosticadores un día adicional de precisión predictiva en comparación con sistemas anteriores.

arxiv arXiv cs.AI · hace 4 d SWE-bench Pro · 78.0%

Argus: Un entorno de ejecución agénico de propósito general para razonamiento a largo plazo

Los investigadores presentan Argus, un entorno de ejecución agénico persistente y autoevolutivo diseñado para el razonamiento a largo plazo que separa la intención estable del usuario de los objetivos operativos. El sistema utiliza roles de Manager, Planner, Engineer y Reviewer para ejecutar misiones acotadas sobre un estado de proyecto duradero, permitiendo la ejecución autónoma entre puntos de escalación propiedad del operador.

media MarkTechPost · hace 4 d

SkillOpt de Microsoft permite la transferencia de habilidades entre Codex y Claude Code

Investigadores de Microsoft, la Universidad Jiao Tong de Shanghái, la Universidad Tongji y la Universidad Fudan desarrollaron SkillOpt, un optimizador en el espacio de texto que entrena documentos de habilidades en lenguaje natural mientras mantiene congelado el modelo objetivo. El sistema utiliza un modelo optimizador para proponer ediciones acotadas basadas en rollouts evaluados, exportando el resultado como un único archivo `best_skill.md`.

arxiv arXiv cs.LG · hace 6 d OSWorld 2.0 · 21.2% · 6 vistas

Qwen lanza Qwen-CUA, un agente de uso nativo del ordenador de 397B-A17B

Qwen presenta Qwen-CUA, un agente de uso nativo del ordenador basado en una columna vertebral de mezcla de expertos de 397B-A17B que opera mediante capturas de pantalla y eventos de entrada sin depender de árboles DOM ni metadatos de accesibilidad. El sistema utiliza un andamio para mantener hasta 20 capturas de pantalla activas y fue entrenado utilizando una flota de despliegue en la nube con casi 100.000 vCPUs a lo largo de aproximadamente 40.000 tareas verificables.

lab OpenAI News · hace 9 d · 16 vistas

El modelo Astra resuelve diez problemas abiertos en matemáticas y ciencias de la computación teóricas

El modelo interno Astra de OpenAI ha generado soluciones a diez problemas abiertos de larga data en matemáticas y ciencias de la computación teóricas, con los argumentos formalizados en Lean. Estos resultados abarcan geometría de alta dimensión, teoría de códigos, teoría de grupos y complejidad cuántica, abordando preguntas que no habían visto avances durante al menos una década.

arxiv arXiv cs.CL · hace 10 d · 2 vistas

Memory Decoder a gran escala: Escalar la memoria paramétrica a largo plazo hasta 6.9B de parámetros

Los investigadores presentan Memory Decoder at Scale, un sistema que escala los modelos de memoria paramétrica a largo plazo hasta 6.9B de parámetros y los preentrena con 300B de tokens. Para abordar la inviabilidad de las tuberías estándar de Faiss a esta escala de datos, los autores implementan una tubería de indexación distribuida con carga dispersa y por lotes de distribuciones kNN.

arxiv arXiv cs.AI · hace 10 d WebArena · 73.6% · 3 vistas

Qwen-UI-Agent establece el estado del arte en pruebas de uso móvil

El equipo de Qwen ha publicado un informe técnico para Qwen-UI-Agent, un agente GUI fundamental centrado en el mundo real diseñado para operar de forma fiable en entornos móviles, de uso en computadora, web y DeepSearch. El sistema combina diversos entornos de sandbox con una ejecución móvil a gran escala en dispositivos reales, intercalando operaciones GUI con ejecución CLI y apoyando tareas de largo alcance.