Tema · Research paper
lab OpenAI News · hace 15 d · 30 vistas

El sistema interno de OpenAI demuestra que las ecuaciones de Navier-Stokes pueden desarrollar singularidades en tiempo finito

OpenAI informa que un sistema de IA interno ha producido una prueba que muestra que la dinámica de las ecuaciones de Navier-Stokes para el movimiento de fluidos puede desarrollar una singularidad en tiempo finito. La solución, derivada por un sistema multiagente impulsado por un modelo significativamente más capaz que GPT-6 Astra, establece la afirmación "C" de la formulación del Premio Millennium.

lab Anthropic News · hace 8 h · 19 vistas

Claude de Anthropic descubre un nuevo sistema enzimático ART en bacteriófagos

Anthropic ha anunciado la creación de un nuevo grupo de investigación en ciencias de la vida dedicado a utilizar Claude para identificar familias de proteínas no caracterizadas y probar hipótesis mediante experimentos de laboratorio. En los primeros resultados, la IA descubrió de forma autónoma un nuevo sistema enzimático llamado transcriptasas inversas asociadas a matrices (ART) encontrado en bacteriófagos.

lab Microsoft Research Blog · hace 2 d · 36 vistas

Microsoft lanza RetroChimera para la predicción de retrosíntesis

Microsoft Research ha publicado y liberado como código abierto RetroChimera, un nuevo marco de trabajo para la predicción de retrosíntesis que combina dos modelos complementarios para proponer rutas de síntesis de alta calidad. El sistema integra R-SMILES 2, un modelo de-novo basado en Transformer, con NeuralLoc, un modelo basado en redes neuronales gráficas (GNN), utilizando una estrategia de ensamble aprendida para clasificar las predicciones.

lab Google DeepMind Blog · hace 20 d · 39 vistas

Google DeepMind lanza WeatherNext 3, un modelo de IA meteorológica global con resolución de hasta 5 km

Google DeepMind y Google Research han presentado WeatherNext 3, un avanzado modelo de IA meteorológica global que genera pronósticos por hora a altas resoluciones espaciales aprendiendo directamente de observaciones satelitales en tiempo real. Esta actualización proporciona pronósticos aproximadamente cinco veces más nítidos que su predecesor, WeatherNext 2, permitiendo predicciones más localizadas para eventos meteorológicos críticos.

lab NVIDIA Research · hace 9 d · 18 vistas

Nvidia introduce modelos extendidos de errores de detectores para componer errores de circuitos cuánticos

El investigador de Nvidia N. Horrocks presenta los modelos extendidos de errores de detectores (EDEMs) diseñados para manejar programas cuánticos tolerantes a fallos con circuitos estabilizadores y errores de Pauli estocásticos. Estos modelos permiten que el análisis de errores se componga en secuencia y paralelo, reflejando la estructura de las realizaciones físicas del circuito.

lab NVIDIA Research · hace 26 d · 27 vistas

Relight permite el guardado de puntos de control distribuido automático y la reproducción rápida hacia adelante para sistemas basados en tareas

Los investigadores presentan Relight, un marco que proporciona guardado automático de puntos de control distribuidos para programas basados en tareas junto con un mecanismo eficiente de reproducción rápida hacia adelante para la recuperación completa del trabajo. A diferencia de los enfoques tradicionales que requieren migración manual de datos, Relight aprovecha la estructura inherente de los cálculos basados en tareas para capturar y reanudar el estado con cambios mínimos en el código.

media Latent Space · hace 15 d · 28 vistas

OpenAI afirma que un resultado sobre singularidad de Navier-Stokes asistido por IA se logró con 10.000 agentes

Cuentas afiliadas a OpenAI informaron que un esfuerzo asistido por IA produjo un resultado relacionado con el problema de existencia y regularidad de Navier-Stokes, uno de los Problemas del Milenio. La afirmación establece que aproximadamente 10.000 agentes colaboraron en la tarea después de ser entrenados durante aproximadamente un año utilizando aprendizaje por refuerzo multiagente.

arxiv arXiv cs.LG · hace 21 d · 69 vistas

Los modelos Nemotron-3 de NVIDIA logran medalla de oro y puntuaciones por encima del nivel humano en la IOI 2026

Los investigadores han desarrollado una canalización post-entrenamiento para modelos de lenguaje grandes que les permite lograr un rendimiento de medalla de oro en programación competitiva. Al combinar el ajuste fino supervisado, el aprendizaje por refuerzo y una nueva estrategia impulsada por retroalimentación llamada GenCorrect, el sistema supera a los mejores concursantes humanos en el conjunto de problemas de la IOI 2026.

arxiv arXiv cs.CL · hace 21 d · 32 vistas

Los modelos NVIDIA Nemotron-3 logran rendimiento de medalla de oro en competiciones de programación IOI

NVIDIA ha desarrollado pipelines de post-entrenamiento para sus modelos de lenguaje Nemotron-3-Nano-CC y Nemotron-3-Ultra-CC con el fin de destacar en programación competitiva. Al combinar la curación a gran escala de problemas, trazas de razonamiento sintético, ajuste fino supervisado (SFT) y aprendizaje por refuerzo, el equipo creó sistemas especializados capaces de realizar razonamiento algorítmico de alto nivel.

arxiv arXiv cs.AI · hace 21 d · 37 vistas

Los modelos Nemotron-3 de NVIDIA logran rendimiento de medalla de oro en competencias de programación de la IOI

NVIDIA ha desarrollado una canalización de postentrenamiento para sus modelos de lenguaje Nemotron-3, permitiendo que alcancen un rendimiento de nivel de medalla de oro en la Olimpiada Internacional de Informática (IOI). El enfoque combina la curación a gran escala de problemas, trazos de razonamiento sintéticos, ajuste fino supervisado y aprendizaje por refuerzo.

lab Hugging Face Blog · hace 30 d GPQA Diamond · 67.4% · 41 vistas

La QAH de Multiverse Computing hace que GPT-OSS de 4 bits supere a su versión original de precisión completa

Multiverse Computing presenta la Curación Consciente de Cuantización (QAH), un método que destila grandes modelos de lenguaje comprimidos y cuantizados directamente a partir de sus maestros originales previos a la compresión. Aplicado a un modelo GPT-OSS 120B comprimido a 60B parámetros y cuantizado a MXFP4, el enfoque produce un modelo que supera su propia versión bfloat16 de precisión completa en 7 de los 9 benchmarks.

arxiv arXiv cs.AI · hace 21 h WebArena · 45.3% · 14 vistas

Growing Harness convierte el control recurrente de agentes en código reutilizable mediante entrenamiento guiado por fallos

Los autores presentan Growing Harness, un paradigma de entrenamiento que aprende la estructura de control de un agente a partir de la retroalimentación de la tarea, en lugar de depender de arneses estándar con gran carga contextual. Al convertir las decisiones de control recurrentes en código ejecutable y reservar las llamadas al LLM para el razonamiento semántico, el método busca crear agentes especialistas reutilizables.

arxiv arXiv cs.LG · hace 21 h · 13 vistas

AIDE^2 permite la mejora recursiva de agentes de investigación con IA

Los investigadores presentan AIDE^2, un sistema que implementa un bucle de mejora recursiva para un agente de investigación con IA de vanguardia optimizando su propio código. El sistema propone cambios en su lógica interna, evalúa las versiones modificadas en tareas de I+D con IA y conserva únicamente aquellas actualizaciones que obtienen el mejor rendimiento en evaluaciones ocultas.

arxiv arXiv cs.CL · hace 1 d · 13 vistas

TelecomGPT-R1: Entrenamiento posterior unificado para el razonamiento en tareas de telecomunicaciones heterogéneas

Los investigadores presentan TelecomGPT-R1, una familia de modelos de razonamiento unificados de telecomunicaciones de código abierto diseñados para automatizar tareas de ingeniería mediante el razonamiento sobre estándares, configuraciones y registros. El modelo aborda las limitaciones de los LLMs existentes de propósito general y especializados a través de un enfoque estructurado que cubre ejes de protocolo, conocimiento, modelado y fallos.

arxiv arXiv cs.LG · hace 2 d HealthBench · 50.1% · 11 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.

arxiv arXiv cs.AI · hace 2 d HealthBench · 50.1% · 14 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.