Un estudio demuestra que la memoria de un modelo de lenguaje que contiene conclusiones incorrectas es más perjudicial que no tener memoria en absoluto. Cuando los modelos retienen valores obsoletos mientras descartan trabajo de apoyo, emiten respuestas confiantes pero erróneas, mientras que las memorias vacías permiten la abstención. Este fenómeno, denominado memoria frágil, se observó en siete modelos donde la dirección del fallo nunca se invirtió independientemente de la tarea o disposición. Los investigadores introdujeron la evaluación reclaim para medir la corregibilidad comprimiendo interacciones y probando si las correcciones recuperan la verdad fundamental sin usar un juez. Los resultados indican que la corregibilidad depende de si la información fuente sobrevive a la compresión en lugar de la capacidad del modelo. Una política centrada en la fuente, que mantiene fuentes recomputables y descarta conclusiones re-derivables, restauró la corregibilidad significativamente mejor que los controles con longitud coincidente. En bucles de memoria encadenados, los errores de fuente descartada corrompen irreparablemente los pasos posteriores, mientras que la corrección propuesta mantiene horizontes de rendimiento acotados. Los hallazgos se replican en tres sistemas desplegados y datos de diálogo reales, con un oráculo construido a mano alcanzando una precisión perfecta.
La evaluación Reclaim muestra que la memoria con pérdida es peor que no tener memoria
InternScience lanza Agents-A1, un modelo MoE de 35B con benchmarks increíbles
InternScience ha lanzado el modelo Agents-A1 en Hugging Face, con una arquitectura de Mezcla de Expertos (MoE) de 35 mil millones de parámetros. El lanzamiento incluye un informe técnico disponible en arXiv y se destaca por su rendimiento excepcional en benchmarks.
Estabilización de la intención de herramientas en RAG en streaming
Un estudio mide la estabilización de la intención de herramientas en RAG en streaming, definiendo cuándo las consultas de herramientas especulativas convergen a respuestas correctas. En el benchmark CRAG, el 73.9% de las consultas permiten ocultar latencia sustancial, con estabilización temprana observada en preguntas con evidencia recuperable literalmente. El tipo de pregunta predice significativamente la estabilización temprana frente a la tardía, informando cuándo los disparadores especulativos son efectivos.
Taxonomía técnica de protocolos de comunicación de agentes LLM
Una nueva taxonomía clasifica los protocolos de comunicación de agentes LLM en cinco dimensiones: contraparte, carga útil, estado de interacción, mecanismo de descubrimiento y flexibilidad del esquema. El análisis muestra que las cargas útiles híbridas, la persistencia del estado de sesión y la negociación de esquemas en tiempo de ejecución son comunes, mientras que el descubrimiento descentralizado sigue siendo raro. El estudio predice una convergencia a corto plazo hacia protocolos unificados de agente-a-agente y agente-a-contexto, y una evolución a largo plazo hacia una pila de protocolos federada y en capas.
GPT-5 y GPT-5 Nano igualan a expertos en la evaluación de investigaciones sobre oncogénesis microbiana
Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.
GPT-5 y GPT-5 Nano igualan a expertos en la extracción de evidencia sobre oncogénesis microbiana
Un estudio que evalúa modelos de lenguaje grandes en la síntesis sistemática de evidencia para la oncogénesis microbiana encontró que GPT-5 y GPT-5 Nano se desempeñan de manera indistinguible de los expertos del dominio. Los investigadores evaluaron Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 y GPT-5 Nano en 24 artículos de investigación utilizando una plantilla estructurada de 77 elementos a través de múltiples tipos de preguntas.