Un estudio mide la estabilización de la intención de herramientas en RAG en streaming, definiendo cuándo las consultas de herramientas especulativas convergen a respuestas correctas. En el benchmark CRAG, el 73.9% de las consultas permiten ocultar latencia sustancial, con estabilización temprana observada en preguntas con evidencia recuperable literalmente. El tipo de pregunta predice significativamente la estabilización temprana frente a la tardía, informando cuándo los disparadores especulativos son efectivos.
Estabilización de la intención de herramientas en RAG en streaming
JAMER: Conjunto de datos y benchmark de marco de código a nivel de proyecto
JAMER presenta JamSet y JamBench, el primer conjunto de datos y benchmark de código de juegos a nivel de proyecto en un motor de juegos profesional. Construido a partir de 8,133 proyectos verificados de Game Jam, permite una evaluación determinista y revela un abismo de capacidad en los modelos de IA a medida que aumenta la escala del proyecto, con tasas de aprobación en tiempo de ejecución que caen de 80.4% a 5.7%.
InternScience lanza Agents-A1, un modelo MoE de 35B con benchmarks increíbles
InternScience ha lanzado el modelo Agents-A1 en Hugging Face, con una arquitectura de Mezcla de Expertos (MoE) de 35 mil millones de parámetros. El lanzamiento incluye un informe técnico disponible en arXiv y se destaca por su rendimiento excepcional en benchmarks.
La evaluación Reclaim muestra que la memoria con pérdida es peor que no tener memoria
Un estudio demuestra que la memoria de un modelo de lenguaje que contiene conclusiones incorrectas es más perjudicial que no tener memoria en absoluto. Cuando los modelos retienen valores obsoletos mientras descartan trabajo de apoyo, emiten respuestas confiantes pero erróneas, mientras que las memorias vacías permiten la abstención. Este fenómeno, denominado memoria frágil, se observó en siete modelos donde la dirección del fallo nunca se invirtió independientemente de la tarea o disposición. Los investigadores introdujeron la evaluación reclaim para medir la corregibilidad comprimiendo interacciones y probando si las correcciones recuperan la verdad fundamental sin usar un juez. Los resultados indican que la corregibilidad depende de si la información fuente sobrevive a la compresión en lugar de la capacidad del modelo. Una política centrada en la fuente, que mantiene fuentes recomputables y descarta conclusiones re-derivables, restauró la corregibilidad significativamente mejor que los controles con longitud coincidente. En bucles de memoria encadenados, los errores de fuente descartada corrompen irreparablemente los pasos posteriores, mientras que la corrección propuesta mantiene horizontes de rendimiento acotados. Los hallazgos se replican en tres sistemas desplegados y datos de diálogo reales, con un oráculo construido a mano alcanzando una precisión perfecta.
BabelJudge: Midiendo la confiabilidad de LLM-as-a-Judge en múltiples idiomas y trayectorias de agentes
BabelJudge introduce un marco de código abierto para medir cuatro modos clave de sesgo en jueces LLM a través de idiomas y trayectorias de agentes. Revela una caída significativa en la confiabilidad del hindi al suajili: de 0.714 a 0.550, destacando una degradación intercultural invisible para la precisión bruta. El marco permite evaluaciones conscientes del sesgo sin etiquetas humanas, utilizando perturbaciones controladas para crear etiquetas doradas conocidas, y se extiende a flujos de trabajo agénticos con nuevas métricas sobre precisión de herramientas y detección de alucinaciones.
Talos: Reanálisis genómico automatizado para el diagnóstico de enfermedades raras
Talos es una herramienta de código abierto que automatiza el reanálisis iterativo de datos genómicos para identificar diagnósticos de enfermedades raras. Logró una tasa de recuperación del 90% de los diagnósticos dentro del alcance con solo 1,3 variantes candidatas por paciente, y proporcionó 241 nuevos diagnósticos en 5.000 pacientes sin diagnóstico, con la mayoría de los nuevos hallazgos emergiendo dentro de los 32 días posteriores a la publicación de la evidencia.