EfficientRollout introduce un marco de descodificación autoespeculativa que reduce el rollout y la latencia end-to-end hasta en un 19,6% y un 12,7% respectivamente, sin comprometer la calidad final del modelo. Utiliza un drafter cuantizado derivado del modelo objetivo e integra una política de conmutación consciente del sistema para evitar regímenes limitados por el cómputo, permitiendo una especulación efectiva durante las generaciones de políticas en evolución.
EfficientRollout: Descodificación autoespeculativa consciente del sistema para rollouts de RL
KVEraser: Borrado localizado eficiente del contexto en LLM
KVEraser permite un borrado localizado eficiente del contexto en modelos de lenguaje grandes al reemplazar únicamente los estados del caché KV de un segmento borrado con estados de dirección aprendidos. Logra un rendimiento cercano al de la recomputación completa en tareas dentro del dominio para longitudes de contexto de 1K a 32K, con solo un aumento de latencia del 24%, y supera a otros métodos aproximados en QA de documentos largos con una aceleración de 3--4x sobre la recomputación completa.
Meta lanza el modelo de peso abierto Muse Glimmer 30B; Anthropic mejora la cota inferior de Riemann
Meta lanzó Muse Glimmer, un modelo multimodal denso de 30B optimizado para el despliegue de agentes locales bajo Apache 2.0, mientras también prometía futuros pesos para Muse Spark 1.2.
Actualizaciones de Muse Spark 1.2 de Meta y GPT-5.6 Sol de OpenAI
Meta anunció que su modelo Muse Spark 1.2 logró un rendimiento de medalla de oro en cinco Olimpiadas de STEM y entró en el top 5 del Índice Vals a $0.69/prueba, según se informa, 3 veces más barato que Kimi. Meta atribuyó estas ganancias a la orquestación multiagente con razonamiento paralelo, destacando puntuaciones perfectas en teoría en APhO e IPhO sin herramientas externas.
AutoPass: Agentes LLM guiados por evidencia para el ajuste de rendimiento del compilador
AutoPass utiliza evidencia en tiempo de ejecución y del compilador para guiar las decisiones de optimización generadas por LLM, superando a heurísticas expertas y métodos clásicos de autotuneo. Logra aceleraciones geométricas medias de 1.043x en sistemas x86-64 y 1.117x en sistemas ARM64 sin entrenamiento previo ni ajuste fino.
Control jerárquico basado en LLM en juegos multiagente
Un sistema jerárquico que utiliza un LLM preentrenado para seleccionar políticas de habilidades de RL supera al RL plano en un entorno King of the Hill 2v2. Igualua el rendimiento de los árboles de comportamiento diseñados a mano en tasa de victoria y es percibido como más humano por el 60% de los usuarios, destacando una coordinación efectiva y adaptabilidad sin diseño manual de reglas.