NatureBench presenta una batería de 90 tareas basadas en artículos de la familia Nature para evaluar la capacidad de los agentes de codificación de IA para lograr descubrimientos científicos. Bajo un protocolo con búsqueda web deshabilitada, el mejor modelo supera el estado del arte anterior solo en el 17.8% de las tareas. Los agentes tienen éxito principalmente al traducir problemas científicos en tareas de aprendizaje supervisado, no mediante invención científica original.
NatureBench evalúa las capacidades de descubrimiento científico de los agentes de codificación de IA
Metis: Uniendo la memoria de texto y código para agentes autoevolutivos
Metis introduce una memoria dual jerárquica que combina memoria de texto y código para mejorar los agentes autoevolutivos. Organiza la experiencia en planes de ejecución, hechos y trampas, cristalizando los planes reutilizables en herramientas validadas solo cuando está justificado. Evaluado en AppWorld, Metis logra hasta un 20.6% más de precisión en tareas y un 22.8% menos de costo de ejecución que ReAct, con un mejor equilibrio general entre precisión, eficiencia y costo de memoria.
CORTIS: Adaptación de Modelos de Lenguaje Hablado Solo con Texto
CORTIS permite que los agentes de voz orientados a tareas generen salidas de habla estructuradas mediante el ajuste fino de modelos de lenguaje hablado utilizando únicamente supervisión de tareas en formato texto. Supera a las cascadas ASR-LLM bajo degradación acústica, especialmente en la preservación de la semántica de alto nivel de la tarea, sin requerir anotaciones emparejadas de habla-objetivo durante el entrenamiento.
Microsoft lanza FastContext de código abierto para agentes de codificación LLM
Microsoft ha liberado como código abierto FastContext-1.0, un subagente ligero de exploración de repositorios que separa la exploración del repositorio de código de la resolución de tareas en agentes de codificación LLM. Utiliza llamadas de herramientas paralelas solo de lectura para devolver rutas de archivo compactas y rangos de líneas, mejorando la precisión de extremo a extremo y reduciendo el uso de tokens hasta un 60.3%, con el modelo 4B-RL superando a un modelo 30B-SFT en SWE-bench Pro.
GLM-5.2 Destaca con un Avance y el Progreso de los Modelos Abiertos
El GLM-5.2 de Zhipu se consolidó como el modelo de peso abierto líder, elogiado por su rendimiento cercano a la vanguardia en el uso diario, con mejoras en tareas de codificación y reducción del costo de inferencia de 1M de tokens mediante IndexShare. Superó a otros modelos abiertos en benchmarks de trabajo de conocimiento agéntico, alcanzando 1266 Elo en la prueba AA-Briefcase de Artificial Analysis, aunque solo el 3% de las tareas fueron completamente satisfechas por los mejores modelos, lo que indica desafíos persistentes en el rendimiento de agentes a largo plazo en el mundo real.
Luchando por completar los créditos del plan de tokens Xiaomi Mimo-v2.5-pro antes de que venzan
Un usuario tiene 24B créditos de tokens de un concurso de planes de tokens de Xiaomi, valorados en $50 pero obtenidos gratis. Informa un alto consumo de tokens durante el uso, soporte limitado para herramientas y ahora está preocupado por desperdiciar los créditos debido a su expiración en cuatro días. El modelo es elogiado por su tasa de aciertos en caché del 90% y una reducción del 99% en el precio de los accesos a la caché, con el usuario señalando que funciona bien en tareas de codificación y planificación.