Wmf - une nouvelle technique expérimentale
Le contenu de l'article a été supprimé par l'auteur, ne laissant aucune information substantielle concernant la technique.
Le contenu de l'article a été supprimé par l'auteur, ne laissant aucune information substantielle concernant la technique.
Un non-programmeur partage son expérience de mise en place d'une infrastructure de modèle linguistique large (LLM) local sur un MacBook M5 Max avec 128 Go de mémoire unifiée. L'utilisateur détaille sa pile logicielle, ses sélections de modèles et ses objectifs pour apprendre l'IA tout en établissant un système stable et accessible à distance.
Together AI présente neuf articles à l'ICML 2026 qui couvrent la pleine pile du développement de sa plateforme.
Hugging Face et Cerebras ont intégré le modèle Gemma 4 de Google dans leurs plateformes pour permettre des applications d'intelligence artificielle vocale en temps réel. Cette collaboration permet aux développeurs d'exploiter les capacités multimodales de Gemma 4 pour des tâches de traitement audio à faible latence.
L'entreprise a levé 800 millions de dollars dans le cadre d'un tour de table de série C visant à accélérer la transition vers l'intelligence artificielle open source.
Cet article présente ScarfBench, un benchmark conçu pour évaluer les performances des agents IA lors de la migration d'applications Java d'entreprise entre différents frameworks. L'étude met en évidence la complexité de la migration de framework et propose une méthode d'évaluation standardisée pour évaluer les capacités des agents dans ce domaine.
La version 1.15.2a1 de crewAI introduit plusieurs nouvelles fonctionnalités, corrections de bugs et mises à jour de documentation pour le framework d'orchestration d'agents.
La version b9857 de llama.cpp introduit une refonte complète de l'implémentation Hexagon Flash Attention, axée sur les optimisations et les améliorations de précision. Cette mise à jour comprend des modifications significatives des modules hex-mm et hex-fa, telles que le regroupement des tâches de quantification dans les threads principaux de matmul, la fusion avec les opérations ADD et l'optimisation du traitement des masques.
Le projet llama.cpp a publié la version b9855, qui introduit une optimisation AVX2 pour le produit scalaire nvfp4 en utilisant une table de consultation (LUT) UE4M3 dans le backend ggml-cpu.
Le projet llama.cpp a publié la version b9856, introduisant une utilisation cohérente du mot-clé `restrict` et de PDL pour Flash Attention dans CUDA. Cette mise à jour est accompagnée de binaires précompilés pour macOS, Linux, Android, Windows et openEuler sur divers backends matériels.
La mise à jour supprime le mécanisme de fallback de navigation Progressive Web App (PWA). Ce changement est mis en œuvre spécifiquement pour empêcher la mise en cache non intentionnelle des requêtes d'endpoint API.
Le projet llama.cpp a publié la version b9852, introduisant un support initial d'OpenCL pour le format de quantisation q1_0. Cette mise à jour inclut des capacités générales pour q1_0 et des implémentations spécifiques de GEMM/GEMV Adreno pour les appareils OpenCL.
Anthropic restaure l'accès mondial à ses modèles Claude Fable 5 et Mythos 5 après que le gouvernement américain a levé les contrôles à l'exportation qui avaient suspendu la disponibilité pour tous les utilisateurs. Fable 5 sera disponible mondialement à partir du 1er juillet sur la plateforme Claude, avec des limites d'utilisation applicables jusqu'au 7 juillet avant de passer à un accès basé sur les crédits.
Le projet llama.cpp a publié la version b9851, qui inclut une correction pour CUDA afin d'éviter les erreurs de troncature entière et de débordement dans le kernel flash_attn_mask_to_KV_max. Cette mise à jour traite des problèmes liés aux pas de masque KQ au sein du kernel spécifié.
La version b9850 de llama.cpp introduit des mises à jour spécifiques du support des modèles, notamment l'enregistrement du tenseur t_layer_inp pour Qwen3Next, la correction de l'affectation d'entrée dans la boucle de traitement des couches, et la résolution des problèmes DFLASH pour qwen-coder-next. Elle ajoute également un tenseur pour la normalisation de l'attention dans le modèle Qwen3.
Le SDK Python du Model Context Protocol (MCP) a publié sa première version bêta, v2.0.0b1, qui introduit une prise en charge complète de la spécification MCP 2026-07-28. Cette préversion est uniquement activable par l'utilisateur, garantissant que les installations standard continuent de se résoudre vers la branche stable 1.x.
Microsoft Research présente SkillOpt, une méthode qui traite les fichiers de compétences des agents comme des paramètres entraînables en dehors d'un modèle cible figé, transformant l'édition manuelle des compétences en un processus d'optimisation contrôlé. Cette approche améliore la fiabilité et la cohérence des agents sans mettre à jour les poids du modèle sous-jacent.
Anthropic a lancé Claude Science en bêta, un poste de travail IA conçu pour intégrer des outils scientifiques fragmentés dans un seul environnement de recherche. La plateforme vise à accélérer la découverte en fournissant des artefacts auditables, une mise à l'échelle flexible du calcul et des agents spécialisés pour des domaines tels que la génomique et la biologie structurale.
Anthropic a publié Claude Sonnet 5, un nouveau modèle d'IA agentique conçu pour effectuer des tâches complexes de planification, d'utilisation d'outils et de codage autonome à un coût inférieur à celui des modèles précédents de classe Opus. Cette mise à jour réduit l'écart de performance avec Opus 4.8 tout en offrant des améliorations significatives en matière de raisonnement, de sécurité et d'exécution par rapport à son prédécesseur, Sonnet 4.6.
Anthropic a publié la version 2.1.197 de Claude Code, qui met à jour le modèle par défaut vers Claude Sonnet 5. Ce nouveau modèle dispose d'une fenêtre de contexte native de 1M de tokens et est disponible avec une tarification promotionnelle jusqu'au 31 août.