Research paper
arxiv arXiv cs.AI · hace 1 h En vivo

Shanghai AI Lab lanza el modelo del mundo físico InternW0 para interacciones eficientes en el mundo real

Shanghai AI Laboratory ha presentado InternW0, la primera instancia de su serie de modelos del mundo físico InternW, diseñada para mantener predicciones accionables en entornos dinámicos. El modelo aprende conjuntamente la dinámica visual futura y el control continuo de robots mediante una arquitectura asimétrica de video-acción con emparejamiento de flujos.

lab Anthropic News · hace 11 h · 22 vistas

Claude de Anthropic descubre un nuevo sistema enzimático ART en bacteriófagos

Anthropic ha anunciado la creación de un nuevo grupo de investigación en ciencias de la vida dedicado a utilizar Claude para identificar familias de proteínas no caracterizadas y probar hipótesis mediante experimentos de laboratorio. En los primeros resultados, la IA descubrió de forma autónoma un nuevo sistema enzimático llamado transcriptasas inversas asociadas a matrices (ART) encontrado en bacteriófagos.

arxiv arXiv cs.AI · hace 1 d WebArena · 45.3% · 14 vistas

Growing Harness convierte el control recurrente de agentes en código reutilizable mediante entrenamiento guiado por fallos

Los autores presentan Growing Harness, un paradigma de entrenamiento que aprende la estructura de control de un agente a partir de la retroalimentación de la tarea, en lugar de depender de arneses estándar con gran carga contextual. Al convertir las decisiones de control recurrentes en código ejecutable y reservar las llamadas al LLM para el razonamiento semántico, el método busca crear agentes especialistas reutilizables.

arxiv arXiv cs.LG · hace 1 d · 13 vistas

AIDE^2 permite la mejora recursiva de agentes de investigación con IA

Los investigadores presentan AIDE^2, un sistema que implementa un bucle de mejora recursiva para un agente de investigación con IA de vanguardia optimizando su propio código. El sistema propone cambios en su lógica interna, evalúa las versiones modificadas en tareas de I+D con IA y conserva únicamente aquellas actualizaciones que obtienen el mejor rendimiento en evaluaciones ocultas.

arxiv arXiv cs.CL · hace 1 d · 13 vistas

TelecomGPT-R1: Entrenamiento posterior unificado para el razonamiento en tareas de telecomunicaciones heterogéneas

Los investigadores presentan TelecomGPT-R1, una familia de modelos de razonamiento unificados de telecomunicaciones de código abierto diseñados para automatizar tareas de ingeniería mediante el razonamiento sobre estándares, configuraciones y registros. El modelo aborda las limitaciones de los LLMs existentes de propósito general y especializados a través de un enfoque estructurado que cubre ejes de protocolo, conocimiento, modelado y fallos.

arxiv arXiv cs.LG · hace 2 d HealthBench · 50.1% · 11 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.

arxiv arXiv cs.AI · hace 2 d HealthBench · 50.1% · 14 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.

lab Microsoft Research Blog · hace 3 d · 40 vistas

Microsoft lanza RetroChimera para la predicción de retrosíntesis

Microsoft Research ha publicado y liberado como código abierto RetroChimera, un nuevo marco de trabajo para la predicción de retrosíntesis que combina dos modelos complementarios para proponer rutas de síntesis de alta calidad. El sistema integra R-SMILES 2, un modelo de-novo basado en Transformer, con NeuralLoc, un modelo basado en redes neuronales gráficas (GNN), utilizando una estrategia de ensamble aprendida para clasificar las predicciones.

arxiv arXiv cs.AI · hace 3 d · 19 vistas

CodeMidas escala entornos de aprendizaje por refuerzo para programación agéntica utilizando código fuente

Los investigadores presentan CodeMidas, una canalización agéntica que construye entornos de aprendizaje por refuerzo a partir de la funcionalidad implementada en repositorios de código abierto, utilizando el código fuente como única entrada. El método asigna cómputo agéntico para explorar la funcionalidad, construir pruebas basadas en la ejecución y validar tareas mediante repeticiones repetidas, lo que resulta en un conjunto de datos de 5.545 tareas de entrenamiento en 23 lenguajes de programación. Entrenar MiMo-V2.5 en estas tareas con GRPO mejora el rendimiento en cinco benchmarks diversos, incluyendo DeepSWE (+11,7%), ProgramBench (+17%) y Terminal-Bench v2.1 (+8,5%). El análisis de trayectorias indica que el agente entrenado con RL exhibe mejores comportamientos, como una mayor exploración del repositorio de código y una autoverificación más diversa. Estos resultados establecen el código fuente como una base escalable para construir entornos de RL que mejoran a los agentes de programación en diversas tareas de software.

arxiv arXiv cs.CL · hace 3 d · 12 vistas

TrialAtlas: un sistema multiagente mejora la evaluación de riesgos en el diseño de ensayos clínicos

Los investigadores han presentado TrialAtlas, una organización de investigación multiagente con memoria aumentada diseñada para asistir en la planificación del desarrollo clínico (CDP). El sistema coordina agentes especializados para la síntesis de literatura, inteligencia competitiva y análisis regulatorio, con el fin de anticipar los riesgos del desarrollo.

media Hugging Face Forums · hace 4 d · 18 vistas

Investigador busca un único anotador independiente para resolver la ambigüedad del acuerdo de LLM

Un investigador está solicitando un único anotador humano independiente para etiquetar 100 escenas narrativas turcas con el fin de determinar si el bajo acuerdo interevaluador se debe a la naturaleza interpretativa de la tarea o a definiciones de anotación insuficientemente especificadas. El estudio encontró que cuatro LLM y un detector basado en reglas coincidieron entre sí y con la referencia humana aproximadamente al azar, con puntuaciones de κ de Cohen que oscilan entre 0.000 y 0.185.

media Hugging Face Forums · hace 4 d · 20 vistas

GlucoEdge: predicción de tendencias glucémicas en el dispositivo con cuantización INT8

El investigador independiente Mohamed Menasy ha publicado GlucoEdge, un estudio de ingeniería que detalla una canalización de aprendizaje automático en el dispositivo de extremo a extremo para la predicción de tendencias glucémicas de cinco clases y 15 minutos a partir de datos de monitores continuos de glucosa. El trabajo introduce un CNN 1D compacto que contiene solo 2.909 parámetros y cubre todo el flujo de trabajo desde PyTorch hasta la conversión a LiteRT.