Un estudio demuestra que la memoria de un modelo de lenguaje que contiene conclusiones incorrectas es más perjudicial que no tener memoria en absoluto. Cuando los modelos retienen valores obsoletos mientras descartan trabajo de apoyo, emiten respuestas confiantes pero erróneas, mientras que las memorias vacías permiten la abstención. Este fenómeno, denominado memoria frágil, se observó en siete modelos donde la dirección del fallo nunca se invirtió independientemente de la tarea o disposición. Los investigadores introdujeron la evaluación reclaim para medir la corregibilidad comprimiendo interacciones y probando si las correcciones recuperan la verdad fundamental sin usar un juez. Los resultados indican que la corregibilidad depende de si la información fuente sobrevive a la compresión en lugar de la capacidad del modelo. Una política centrada en la fuente, que mantiene fuentes recomputables y descarta conclusiones re-derivables, restauró la corregibilidad significativamente mejor que los controles con longitud coincidente. En bucles de memoria encadenados, los errores de fuente descartada corrompen irreparablemente los pasos posteriores, mientras que la corrección propuesta mantiene horizontes de rendimiento acotados. Los hallazgos se replican en tres sistemas desplegados y datos de diálogo reales, con un oráculo construido a mano alcanzando una precisión perfecta.
La evaluación Reclaim muestra que la memoria con pérdida es peor que no tener memoria
InternScience lanza Agents-A1, un modelo MoE de 35B con benchmarks increíbles
InternScience ha lanzado el modelo Agents-A1 en Hugging Face, con una arquitectura de Mezcla de Expertos (MoE) de 35 mil millones de parámetros. El lanzamiento incluye un informe técnico disponible en arXiv y se destaca por su rendimiento excepcional en benchmarks.
Estabilización de la intención de herramientas en RAG en streaming
Un estudio mide la estabilización de la intención de herramientas en RAG en streaming, definiendo cuándo las consultas de herramientas especulativas convergen a respuestas correctas. En el benchmark CRAG, el 73.9% de las consultas permiten ocultar latencia sustancial, con estabilización temprana observada en preguntas con evidencia recuperable literalmente. El tipo de pregunta predice significativamente la estabilización temprana frente a la tardía, informando cuándo los disparadores especulativos son efectivos.
Taxonomía técnica de protocolos de comunicación de agentes LLM
Una nueva taxonomía clasifica los protocolos de comunicación de agentes LLM en cinco dimensiones: contraparte, carga útil, estado de interacción, mecanismo de descubrimiento y flexibilidad del esquema. El análisis muestra que las cargas útiles híbridas, la persistencia del estado de sesión y la negociación de esquemas en tiempo de ejecución son comunes, mientras que el descubrimiento descentralizado sigue siendo raro. El estudio predice una convergencia a corto plazo hacia protocolos unificados de agente-a-agente y agente-a-contexto, y una evolución a largo plazo hacia una pila de protocolos federada y en capas.
El ranking Open TTS lanza una evaluación escalable de TTS multilingüe
Se ha publicado el ranking Open TTS para abordar la fragmentación y la falta de estandarización en la evaluación del texto a voz (TTS), utilizando métricas objetivas en lugar de depender únicamente de puntuaciones lentas de preferencia humana basadas en arenas. Evalúa modelos en inteligibilidad, velocidad y similitud del hablante mediante incrustaciones de Qwen3 ASR y WavLM.
Rep2Act alinea las representaciones de los VLM para mejorar la abstención en el nuevo benchmark VAD-R
Los investigadores presentan Visual Answerability Diagnosis with Rationales (VAD-R), un nuevo benchmark diseñado para evaluar la capacidad de los modelos de visión y lenguaje de abstenerse de preguntas sin respuesta sin depender de atajos. El estudio revela que, aunque los estados ocultos pueden distinguir la capacidad de respuesta, los modelos actuales no logran traducir esto en decisiones explícitas.