Tema · Research paper
lab Google DeepMind Blog · hace 3 d · 16 vistas

Google DeepMind abre el código fuente del modelo de IA WeatherNext para la predicción de ciclones

Google DeepMind y Google Research han abierto el código fuente de los modelos de IA WeatherNext 2 y WeatherNext Cyclones, que lograron una precisión de última generación en la predicción de trayectorias, intensidad y estructura del viento de ciclones tropicales. Publicado en Nature, el trabajo demuestra que estos modelos proporcionan a los pronosticadores un día adicional de precisión predictiva en comparación con sistemas anteriores.

lab OpenAI News · hace 9 d · 16 vistas

El modelo Astra resuelve diez problemas abiertos en matemáticas y ciencias de la computación teóricas

El modelo interno Astra de OpenAI ha generado soluciones a diez problemas abiertos de larga data en matemáticas y ciencias de la computación teóricas, con los argumentos formalizados en Lean. Estos resultados abarcan geometría de alta dimensión, teoría de códigos, teoría de grupos y complejidad cuántica, abordando preguntas que no habían visto avances durante al menos una década.

lab NVIDIA Research · hace 26 d

Estudio de RV encuentra que pacientes con IVT tienen detección de colisiones más lenta y mayores márgenes de seguridad

Los investigadores desarrollaron una tarea inmersiva de realidad virtual para evaluar la detección y evitación de colisiones peatonales en individuos con impedimento visual cerebral (IVT) en comparación con participantes de control. El estudio rastreó la mirada ocular, respuestas locomotoras y conductuales mientras los sujetos caminaban por un centro comercial simulado poblado con multitudes de diversas densidades.

arxiv arXiv cs.LG · hace 13 d · 2 vistas

Moonshot AI lanza Kimi K3, un modelo MoE de 2.8T parámetros con contexto de millón de tokens

Moonshot AI ha presentado Kimi K3, un modelo Mixture-of-Experts de código abierto que cuenta con 2.8 billones de parámetros totales y 104 mil millones de parámetros activados por token. El modelo admite capacidades nativas de visión y una ventana de contexto de 1 millón de tokens, aprovechando Kimi Delta Attention y Stable LatentMoE para lograr una eficiencia de escalado aproximada de 2.5x en comparación con su predecesor, Kimi K2.

arxiv arXiv cs.LG · hace 3 d

U-OPSD permite la auto-distilación no supervisada en política para LLM

Los investigadores proponen la Auto-Distilación No Supervisada en Política (U-OPSD), un método que logra una mejora post-entrenamiento para modelos de lenguaje grandes utilizando únicamente las propias generaciones del modelo sin supervisión externa. El enfoque muestrea múltiples trayectorias para construir una pseudo-solución mediante votación mayoritaria, luego destila una distribución docente en los prefijos de la finalización incorrecta más larga del modelo.

arxiv arXiv cs.CL · hace 3 d · 4 vistas

M$^3$R-Bench presenta un benchmark fundamentado en evidencia para la comprensión de metáforas multimodales

Los investigadores presentan M$^3$R-Bench, un benchmark unificado que contiene 1.000 instancias de imagen-texto con anotaciones verificadas por humanos diseñadas para evaluar la comprensión de metáforas multimodales fundamentadas en evidencia. El benchmark proporciona anotaciones conjuntas para la ocurrencia de metáforas, el mapeo Objetivo-Fuente, el sentimiento y explicaciones por etapas basadas en la Teoría de las Metáforas Conceptuales.

arxiv arXiv cs.AI · hace 4 d SWE-bench Pro · 78.0%

Argus: Un entorno de ejecución agénico de propósito general para razonamiento a largo plazo

Los investigadores presentan Argus, un entorno de ejecución agénico persistente y autoevolutivo diseñado para el razonamiento a largo plazo que separa la intención estable del usuario de los objetivos operativos. El sistema utiliza roles de Manager, Planner, Engineer y Reviewer para ejecutar misiones acotadas sobre un estado de proyecto duradero, permitiendo la ejecución autónoma entre puntos de escalación propiedad del operador.

media MarkTechPost · hace 4 d

SkillOpt de Microsoft permite la transferencia de habilidades entre Codex y Claude Code

Investigadores de Microsoft, la Universidad Jiao Tong de Shanghái, la Universidad Tongji y la Universidad Fudan desarrollaron SkillOpt, un optimizador en el espacio de texto que entrena documentos de habilidades en lenguaje natural mientras mantiene congelado el modelo objetivo. El sistema utiliza un modelo optimizador para proponer ediciones acotadas basadas en rollouts evaluados, exportando el resultado como un único archivo `best_skill.md`.

arxiv arXiv cs.LG · hace 6 d OSWorld 2.0 · 21.2% · 6 vistas

Qwen lanza Qwen-CUA, un agente de uso nativo del ordenador de 397B-A17B

Qwen presenta Qwen-CUA, un agente de uso nativo del ordenador basado en una columna vertebral de mezcla de expertos de 397B-A17B que opera mediante capturas de pantalla y eventos de entrada sin depender de árboles DOM ni metadatos de accesibilidad. El sistema utiliza un andamio para mantener hasta 20 capturas de pantalla activas y fue entrenado utilizando una flota de despliegue en la nube con casi 100.000 vCPUs a lo largo de aproximadamente 40.000 tareas verificables.