La implementación de CUDA se ha actualizado para priorizar las estrategias de programación de tiles completos para FlashAttention. Este cambio tiene como objetivo optimizar el flujo de ejecución de los mecanismos de atención dentro del marco.
CUDA prefiere la programación de tiles completos en FlashAttention
Eqx-zoo proporciona puertos verificados de modelos Equinox de Hugging Face
El autor ha creado eqx-zoo, una biblioteca que carga checkpoints de Hugging Face Hub directamente como módulos plain de Equinox y verifica cada modelo contra la biblioteca transformers. El proyecto actualmente soporta Llama, Qwen2, Qwen3, Qwen3-MoE para generación, y BERT, RoBERTa, XLM-RoBERTa para embeddings.
La versión b11401 de llama.cpp corrige el registro y habilita colores ANSI en Windows
La versión b11401 de llama.cpp aborda problemas de registro en el modo enrutador del servidor y añade soporte para colores ANSI en la consola de Windows. Esta actualización asegura que los registros de procesos hijos estén correctamente separados de los comandos de estado y que la salida coloreada se muestre adecuadamente en terminales de Windows.
Aleph Alpha lanza Kolibri, un modelo MoE de 78.1B para inglés y alemán con 3.46B de parámetros activos
Aleph Alpha ha lanzado Kolibri-1, un modelo de lenguaje Mixture-of-Experts de pesos abiertos diseñado para tareas bilingües en inglés y alemán. El modelo cuenta con 78.100 millones de parámetros totales pero activa solo 3.460 millones por token, lo que le permite ejecutarse en una única GPU B200, B300 o H200.
llama.cpp b11390 corrige fallo de memoria CUDA MMQ
El proyecto llama.cpp ha lanzado la versión b11390, que incluye una corrección para un fallo de memoria CUDA MMQ que ocurría cuando el número de expertos era significativamente mayor que el tamaño del micro-lote.
llama.cpp b11382 añade soporte f16 a WebGPU fill/set_rows
El proyecto llama.cpp ha lanzado la compilación b11382, que incluye una actualización clave para su backend de WebGPU. Esta versión añade soporte de punto flotante de 16 bits (f16) específicamente para las operaciones `fill` y `set_rows` dentro de la implementación de WebGPU.