L'implémentation CUDA a été mise à jour pour prioriser les stratégies de planification de tuiles complètes pour FlashAttention. Ce changement vise à optimiser le flux d'exécution des mécanismes d'attention au sein du framework.
CUDA privilégie la planification de tuiles complètes pour FlashAttention
Eqx-zoo fournit des ports vérifiés de modèles Equinox pour Hugging Face
L'auteur a construit eqx-zoo, une bibliothèque qui charge les checkpoints de Hugging Face Hub directement en tant que modules plain d'Equinox et vérifie chaque modèle contre la bibliothèque transformers. Le projet prend actuellement en charge Llama, Qwen2, Qwen3, Qwen3-MoE pour la génération, et BERT, RoBERTa, XLM-RoBERTa pour les embeddings.
La version b11401 de llama.cpp corrige la journalisation et active les couleurs ANSI sous Windows
La version b11401 de llama.cpp résout les problèmes de journalisation dans le mode routeur du serveur et ajoute la prise en charge des couleurs ANSI sur la console Windows. Cette mise à jour garantit que les journaux des processus enfants sont correctement séparés des commandes d'état et que la sortie colorée est rendue correctement sur les terminaux Windows.
Aleph Alpha publie Kolibri, un modèle MoE anglais-allemand de 78,1 milliards de paramètres avec 3,46 milliards de paramètres actifs
Aleph Alpha a publié Kolibri-1, un modèle de langage à experts mixtes (Mixture-of-Experts) à poids ouverts conçu pour des tâches bilingues en anglais et en allemand. Le modèle compte 78,1 milliards de paramètres au total mais n'en active que 3,46 milliards par token, ce qui lui permet de fonctionner sur un seul GPU B200, B300 ou H200.
llama.cpp b11390 corrige une erreur de mémoire CUDA MMQ
Le projet llama.cpp a publié la version b11390, qui inclut une correction pour une erreur de mémoire CUDA MMQ survenant lorsque le nombre d'experts était significativement supérieur à la taille du micro-lot.
llama.cpp b11382 ajoute le support f16 à WebGPU fill/set_rows
Le projet llama.cpp a publié la compilation b11382, qui inclut une mise à jour majeure de son backend WebGPU. Cette version ajoute le support des nombres en virgule flottante 16 bits (f16) spécifiquement pour les opérations `fill` et `set_rows` au sein de l'implémentation WebGPU.