Selon les rapports, Apple planifie une puce M7 Ultra qui prendra en charge jusqu'à 1,5 To de mémoire unifiée.
La spécification prévue met en évidence une augmentation significative de la capacité de mémoire pour les futures puces Apple silicon.
Selon les rapports, Apple planifie une puce M7 Ultra qui prendra en charge jusqu'à 1,5 To de mémoire unifiée.
La spécification prévue met en évidence une augmentation significative de la capacité de mémoire pour les futures puces Apple silicon.
L'article calcule quels grands modèles de langage ouverts tiennent dans les nouveaux Macs de la série Apple M5 (Mac mini, Mac Studio) en analysant les contraintes mémoire plutôt qu'en exécutant des benchmarks. Il détermine la capacité en fonction des tailles de fichiers GGUF Q4_K_M, des exigences du cache KV et de la surcharge d'exécution par rapport à la mémoire GPU utilisable.
Les chercheurs présentent BaseRT, un runtime d'inférence Metal natif pour les grands modèles de langage sur Apple Silicon qui atteint le débit d'inférence le plus élevé jamais rapporté à ce jour. En utilisant la fusion de noyaux spécifique au processeur et une optimisation consciente de la mémoire unifiée, il surmonte les surcharges présentes dans les frameworks existants comme llama.cpp et MLX.
Le projet llama.cpp a publié la version b11160, introduisant une implémentation de matrice coopérative int8 (coopmat1) pour Vulkan sur les architectures AMD RDNA3 et RDNA4. Cette mise à jour inclut un shader dédié qui sonde directement les valeurs coopmat pour améliorer les performances.
Lors de Meta Connect 2026, Meta a présenté son agent personnel Muse comme le centre d'une stratégie combinant matériel et agents, introduisant de nouvelles fonctionnalités et appareils tout en annonçant un modèle de pointe futur. L'entreprise a mis en avant les capacités étendues de Muse, notamment les interactions vocales et vidéo en temps réel, ainsi que de nouveaux équipements tels que des lunettes VR et le porte-clés Charm.
Apple a lancé LensVLM-9B, un Modèle de Langage Visuel de 9 milliards de paramètres conçu pour traiter plus efficacement des images de texte compressées. Le modèle scanne ces entrées compressées et utilise des outils appris pour étendre sélectivement uniquement les pages pertinentes à leur forme non compressée.
Nous utilisons des cookies pour mesurer l'audience et améliorer le site. Vous pouvez accepter ou refuser les cookies analytiques. Politique de confidentialité