Source · Hugging Face Blog
lab Hugging Face Blog · il y a 1 j · 8 vues

NVIDIA publie le modèle fondamental Kumo Tabular open source pour la prédiction tabulaire en zéro-shot

NVIDIA a publié Kumo Tabular, un modèle fondamental open source pour la classification et la régression tabulaires qui fonctionne par apprentissage in-context sans nécessiter d'entraînement ni d'ingénierie des fonctionnalités. Pré-entraîné exclusivement sur des données artificielles générées par des Modèles Causaux Structurels, le modèle est disponible en trois tailles allant de 28M à 215M paramètres.

lab Hugging Face Blog · il y a 2 j OSWorld 2.0 · 61.7% · 9 vues

Holo4 : des modèles agents généralistes pour les interfaces graphiques, le code et les API

Holo4 est une nouvelle série de modèles agents de H Company, disponible en tailles 27B dense et 35B-A3B Mixture of Experts. Ces modèles interagissent avec les logiciels via n'importe quelle interface — interfaces graphiques (GUI), code, MCP ou API — et s'exécutent sur les ordinateurs de bureau, le web, Android et des environnements isolés en utilisant le même modèle.

lab Hugging Face Blog · il y a 4 h · 1 vue

Lancement du classement Open TTS pour l'évaluation évolutive de la synthèse vocale multilingue

Le classement Open TTS a été publié pour répondre à la fragmentation et au manque de standardisation dans l'évaluation de la synthèse vocale (TTS) en utilisant des métriques objectives plutôt que de se fier uniquement aux scores de préférence humaine basés sur des arènes, qui sont lents. Il évalue les modèles sur l'intelligibilité, la vitesse et la similarité du locuteur en utilisant les embeddings Qwen3 ASR et WavLM.

lab Hugging Face Blog · il y a 1 j · 1 vue

ProvenanceGuard ajoute une vérification consciente de la source aux agents MCP

ProvenanceGuard est une couche de vérification post-génération pour les agents du protocole Model Context Protocol (MCP) qui détecte la confusion inter-sources en s'assurant que les affirmations sont attribuées à la bonne source d'évidence. Le système analyse les traces MCP capturées sans réentraîner l'agent, décompose les réponses en affirmations et vérifie que la source de soutien correspond à celle nommée ou implicite dans la sortie.

lab Hugging Face Blog · il y a 6 j · 13 vues

Liquid AI publie LFM2.5-VL-DSpark pour accélérer l'inférence des modèles vision-langage

Liquid AI a publié le modèle brouillon LFM2.5-VL-DSpark, un drafter de décodage spéculatif conçu pour accélérer l'inférence du modèle vision-langage LFM2.5-VL-3B. Le drafter capture les états cachés des couches fixes du modèle cible pour générer des tokens candidats, n'ajoutant que 280M de paramètres (surcharge de 8,9 %) tout en maintenant une dimensionalité identique entre les modalités.

lab Hugging Face Blog · il y a 7 j · 16 vues

NVIDIA Warp et MjWarp permettent la simulation robotique parallèle accélérée par GPU

MuJoCo Warp (MJWarp), construit sur NVIDIA Warp, permet aux modèles MuJoCo compatibles de s'exécuter à l'échelle du GPU, permettant le déploiement de centaines ou de milliers de mondes de simulation indépendants en un seul appel. Cette architecture déplace le focus de la minimisation de la latence pour un environnement unique vers l'amélioration du débit agrégé, ce qui favorise l'apprentissage par renforcement et l'échantillonnage à grande échelle.

lab Hugging Face Blog · il y a 7 j · 27 vues

NVIDIA publie le modèle Nemotron 3 Diarization à poids ouverts

NVIDIA a publié Nemotron 3 Diarization, un modèle à poids ouverts de 100 millions de paramètres pour la diarisation des locuteurs en temps réel, prenant en charge jusqu'à huit locuteurs. Le modèle se classe #1 sur le classement VoiceArena's Diarization-Bench avec un taux d'erreur de diarisation (DER) de 14,72 %, surpassant le système suivant d'une réduction relative d'environ 24 %.

lab Hugging Face Blog · il y a 8 j · 25 vues

L'AISI publie des résultats d'évaluation vérifiés pour six modèles de pointe sur cinq benchmarks

L'Institut britannique pour la sécurité de l'IA (AISI) a rendu accessibles publiquement les méthodes d'évaluation et les conclusions via la plateforme Evaluation Cards d'EvalEval afin d'améliorer la reproductibilité des benchmarks. Cette publication inclut des résultats vérifiés, du contexte et des informations de configuration pour cinq benchmarks spécifiques : HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro et Terminal-Bench 2.0.

lab Hugging Face Blog · il y a 8 j · 24 vues

Transformers ajoute le support GGUF via les noyaux ggml pour l'inférence locale

La bibliothèque Transformers de Hugging Face prend désormais en charge le chargement de modèles quantifiés GGUF, en s'appuyant sur les noyaux ggml sous-jacents pour offrir des performances proches de celles de llama.cpp. Cette intégration permet aux développeurs d'exécuter des points de contrôle quantifiés directement au sein de l'API standard basée sur PyTorch sur le matériel pris en charge.

lab Hugging Face Blog · il y a 9 j · 12 vues

tokenizers v1 version candidate offre un encodage 3 à 30 fois plus rapide grâce au fractionnement et à la mise en cache du bitstream

La bibliothèque tokenizers a publié une version candidate pour la version 1 qui améliore considérablement les performances de l'encodage de texte, en résolvant les goulots d'étranglement dans les flux de travail d'entraînement et de service. La mise à jour maintient la compatibilité de l'API avec la v0.23 tout en offrant des accélérations substantielles sur dix familles de modèles.

lab Hugging Face Blog · il y a 9 j MMLU · 77.0% · 17 vues

Multiverse reformule la suppression de blocs LLM en optimisation d'Ising pour une compression profonde

Multiverse a publié un article détaillant une méthode qui reformule l'élagage des grands modèles de langage comme un problème d'optimisation binaire sous contrainte mappé à un verre d'Ising. En traitant les blocs transformeur comme des spins avec des couplages par paire dérivés de l'hessienne de la perte, l'approche identifie les configurations optimales de suppression de blocs sans nécessiter de benchmarking itératif.

lab Hugging Face Blog · il y a 15 j · 20 vues

ALTK-Evolve introduit des lignes directrices de cohérence pour réduire de moitié les écarts de fiabilité des agents

Des chercheurs ont introduit des « lignes directrices de cohérence » au sein du système ALTK-Evolve, un nouveau mécanisme conçu pour traiter la variabilité des performances des agents LLM que masquent souvent les métriques standard de précision moyenne. En identifiant et stabilisant les points de décision sujets à des inversions, cette approche améliore considérablement la cohérence du succès des tâches sans sacrifier la capacité globale.

lab Hugging Face Blog · il y a 16 j · 19 vues

TRL v1.14 AsyncGRPOTrainer permet la synchronisation uniquement LoRA sur les Jobs Hugging Face

TRL v1.14 introduit le support de LoRA pour l'AsyncGRPOTrainer, lui permettant d'entraîner un adaptateur Low-Rank Adaptation et de synchroniser uniquement ce petit fichier avec les workers d'inférence vLLM. Cette architecture découple les tâches d'entraînement et de génération sur des machines séparées en utilisant un Storage Bucket partagé comme pont de système de fichiers, éliminant ainsi le besoin de NCCL ou de communication réseau directe entre les nœuds.

lab Hugging Face Blog · il y a 20 j · 29 vues

Gradio publie Workflow1111, reconstruisant les fonctionnalités d'AUTOMATIC1111 sous forme de graphe Gradio

Gradio a publié Workflow1111, un projet qui reconstruit la plupart des fonctionnalités de stable-diffusion-webui d'AUTOMATIC1111 en utilisant le framework gr.Workflow. L'application se compose d'un seul canevas contenant onze pipelines multimédias construits à partir de soixante-treize nœuds, couvrant la génération d'images à partir de texte, la vidéo à partir d'images et diverses tâches de prétraitement.

lab Hugging Face Blog · il y a 22 j · 28 vues

Multiverse Computing propose l'auto-distillation sensible aux limites pour un refus précis de la sécurité des LLM

Un article de Multiverse Computing présente une méthode pour entraîner les modèles de langage à refuser uniquement des sous-ensembles spécifiques nuisibles d'un sujet, plutôt que toute la catégorie, afin de pallier les limites des garde-fous bruts au niveau du sujet. L'approche utilise une auto-distillation sensible aux limites avec réparation de la couverture et des données bénignes dans la distribution pour maintenir la sécurité tout en réduisant les faux rejets sur les invites légitimes.

lab Hugging Face Blog · il y a 27 j · 37 vues

NeoMME publie des encodeurs multimodaux efficaces avec recherche à interaction dense et tardive

Les chercheurs présentent NeoMME, une famille d'encodeurs multimodaux multilingues de 260M et 800M paramètres qui traitent le texte et les patches d'image bruts à l'aide d'un seul Transformer bidirectionnel. Contrairement aux modèles de langage visuel génératifs, NeoMME ne repose pas sur des tours de vision pré-entraînés séparés ou des décodeurs causaux ; il est entraîné entièrement从零 avec un objectif de diffusion discrète masquée.