IQuest ha lanzado IQuest-Q1, un modelo Mixture-of-Experts (MoE) diseñado para codificación agéntica, razonamiento y uso de herramientas en múltiples pasos. El modelo comprende aproximadamente 320 mil millones de parámetros totales, con unos 15 mil millones de parámetros activados por token. Está disponible en Hugging Face.
IQuestLab lanza IQuest-Q1, un modelo MoE de 320B para codificación agéntica
H Company lanza modelos de uso informático Holo4 de peso abierto para escritorio, web y móvil
H Company ha lanzado Holo4, una familia de modelos de visión y lenguaje de uso general diseñados para hacer clic, escribir, generar código y llamar a herramientas en entornos de escritorio, web, Android y API. El lanzamiento incluye dos tamaños de modelo: Holo4 27B (denso) y Holo4 35B-A3B (Mezcla de Expertos con 3B parámetros activos), ambos con soporte para una ventana de contexto de 256K.
Tmax: Una receta RL sencilla para agentes terminales
Tmax presenta la mejor receta RL de código abierto para agentes terminales, alcanzando un 27% en Terminal-Bench 2.0 con solo 9B parámetros. Utiliza una taxonomía de datos novedosa para generar más de 2.5x entornos terminales que los conjuntos de datos anteriores, permitiendo un entrenamiento eficiente con una receta sencilla basada únicamente en el resultado. El conjunto de datos, los modelos y el código se han publicado como código abierto en https://github.com/hamishivi/tmax.
Usuario como Engrama: Ediciones paramétricas locales para memoria personal
User as Engram propone almacenar los hechos por usuario como ediciones quirúrgicas con clave hash en una tabla de memoria, dejando el razonamiento en un adaptador compartido. Este diseño logra una precisión de razonamiento indirecto 5.6x mayor y mantiene el rendimiento de razonamiento base, con una huella de memoria 33,000x más pequeña que LoRA por usuario. El enfoque permite ediciones de usuarios independientes que se componen sin pérdidas, superando a los pipelines de recuperación más allá de 100 hechos.
OWL alcanza el #1 en el benchmark GAIA con una puntuación de 69.09%
El framework OWL para la colaboración multiagente ha alcanzado el primer puesto entre los frameworks de código abierto en el benchmark GAIA, obteniendo una puntuación de 69.09%. Este resultado se anunció en abril de 2025, tras un logro anterior del 58.18% en marzo.
La reproducción de DeepResearch de código abierto alcanza 55.15% en GAIA usando smolagents
Tras el lanzamiento de Deep Research por parte de OpenAI, un equipo reprodujo su marco agéntico en 24 horas y liberó la implementación a través de la biblioteca smolagents. El sistema resultante integra un LLM con herramientas para navegación web e inspección de texto para realizar tareas de razonamiento multi-paso.