El equipo de PLN de la Universidad Estatal de Ohio ha lanzado QUEST-35B, un agente de investigación profunda de código abierto entrenado en aproximadamente 32 GPUs H100 utilizando 8.000 muestras sintéticas. El equipo ha liberado como código abierto la receta de entrenamiento, el código, los pesos y los conjuntos de datos, con resultados de evaluación que muestran un rendimiento competitivo en comparación con los principales sistemas de investigación profunda de código cerrado.
La Universidad Estatal de Ohio lanza el agente de investigación profunda QUEST-35B de código abierto
La Universidad Estatal de Ohio lanza el agente de investigación profunda QUEST-35B de código abierto
Los investigadores de la Universidad Estatal de Ohio entrenaron QUEST-35B, un agente de investigación profunda, utilizando aproximadamente 32 GPUs H100 y 8.000 muestras sintéticas. Han liberado como código abierto la receta de entrenamiento, el código, los pesos y los conjuntos de datos, con resultados de evaluación que muestran un rendimiento competitivo en comparación con los principales sistemas de investigación profunda propietarios.
Claude de Anthropic mejora el límite de la hipótesis de Riemann; Meta lanza Muse Glimmer; OpenAI presenta GPT-5.6-Cyber
Esta edición de TLDR AI cubre tres desarrollos importantes: el modelo Claude de Anthropic mejoró significativamente el límite inferior para los ceros que satisfacen la hipótesis de Riemann, Meta lanzó el modelo de peso abierto Muse Glimmer y OpenAI presentó un modelo especializado en ciberseguridad.
Google abre el código fuente de los modelos WeatherNext; Meta explora la sinergia multimodal
Google ha abierto el código fuente de sus modelos de IA WeatherNext 2 y WeatherNext Cyclones para mejorar la precisión en la predicción de ciclones. Los modelos logran resultados state-of-the-art en la predicción de trayectoria, intensidad y estructura del viento, proporcionando a los pronosticadores un día adicional promedio de precisión predictiva en comparación con los métodos actuales.
OpenBioRQ: Benchmark para la Fidelidad de la Investigación Biomédica Agéntica
OpenBioRQ introduce un benchmark de 12,553 preguntas de investigación biomédica sin resolver en 12 dominios, diseñado para probar la fidelidad y la abstención de los modelos agénticos. Evalúa los modelos en un entorno de uso de herramientas sin claves de respuesta, utilizando evidencia real de seguimiento en lugar de conocimiento paramétrico, y revela un colapso agéntico significativo en las preguntas más difíciles donde las herramientas ya no se utilizan a pesar de ser críticas.
Alineación de LLM mediante Retroalimentación Implícita del Usuario
Un nuevo conjunto de datos, IFLLM, recopila trayectorias del ratón y datos de fijación ocular de usuarios que interactúan con LLMs. Muestra que la retroalimentación implícita mejora significativamente la alineación de LLMs, aumentando la precisión del modelo de recompensa basado en texto del 55% al 64% y casi triplicando las mejoras en la calidad de respuesta después del entrenamiento DPO en ocho LLMs.