Tema · Reasoning models
lab OpenAI News · hace 18 d · 38 vistas

OpenAI advierte sobre el riesgo de la IA a medida que escalan los modelos de razonamiento

En un ensayo titulado "An Alien Mind", OpenAI analiza el rápido avance de los modelos de lenguaje de razonamiento y el potencial para la mejora recursiva. El autor expresa preocupación porque la inteligencia artificial está superando las capacidades humanas de formas transformadoras, impulsada principalmente por el aumento del poder computacional en lugar de algoritmos diseñados.

lab NVIDIA Research · hace 12 d · 12 vistas

ReasAlign utiliza razonamiento para defender agentes de LLM contra inyección de instrucciones

Los investigadores han presentado ReasAlign, una solución a nivel de modelo diseñada para mejorar la alineación de seguridad en Modelos de Lenguaje Grande (LLM) frente a ataques de inyección indirecta de instrucciones. El enfoque incorpora pasos de razonamiento estructurados para analizar las consultas del usuario y detectar instrucciones conflictivas, asegurando la continuidad de las tareas pretendidas por el usuario.

media AI News (smol.ai) · hace 11 d · 28 vistas

OpenAI afirma haber logrado un resultado sobre singularidad de Navier-Stokes asistido por IA mediante colaboración de 10.000 agentes

Cuentas afiliadas a OpenAI informaron que un esfuerzo asistido por IA produjo un resultado relacionado con el problema de existencia y regularidad de Navier-Stokes, uno de los Problemas del Milenio. La afirmación se centra en un sistema colaborativo que involucra aproximadamente 10.000 agentes entrenados durante un año mediante aprendizaje por refuerzo multi-agente.

arxiv arXiv cs.CL · hace 1 d · 13 vistas

TelecomGPT-R1: Entrenamiento posterior unificado para el razonamiento en tareas de telecomunicaciones heterogéneas

Los investigadores presentan TelecomGPT-R1, una familia de modelos de razonamiento unificados de telecomunicaciones de código abierto diseñados para automatizar tareas de ingeniería mediante el razonamiento sobre estándares, configuraciones y registros. El modelo aborda las limitaciones de los LLMs existentes de propósito general y especializados a través de un enfoque estructurado que cubre ejes de protocolo, conocimiento, modelado y fallos.

media Hugging Face Forums · hace 2 d · 11 vistas

CosmicUndercurrent lanza Principia-Structurae-Realitatis para probar la coordinación de todo el sistema en LLM

CosmicUndercurrent ha publicado como código abierto un marco de razonamiento agnóstico a modelos diseñado para evaluar si el priming estructural puede reducir las inconsistencias globales en los grandes modelos de lenguaje. El proyecto, alojado, investiga si un proceso de dos pasos mejora la coordinación de todo el sistema en comparación con la corrección local.

blog Simon Willison · hace 22 d · 40 vistas

Anthropic lanza Claude Fable 5.1 con mejoras en benchmarks de programación y ciencias

Anthropic ha lanzado Claude Fable 5.1, una actualización del modelo que establece un nuevo estándar para tareas de programación, trabajo de conocimiento y resolución de problemas de larga duración. El lanzamiento destaca importantes ganancias de rendimiento en el nuevo benchmark Terminal-Bench-Science 0.1, donde Fable 5.1 logró una puntuación de 52.6%, en comparación con 24.7% para Fable 5, 29.0% para Opus 5 y 22.4% para GPT-5.6 Sol.