Sujet · Open weights
lab Microsoft Research Blog · il y a 9 j · 62 vues

Microsoft publie RetroChimera pour la prédiction de rétrosynthèse

Microsoft Research a publié et open-sourcé RetroChimera, un nouveau cadre de prédiction de rétrosynthèse qui combine deux modèles complémentaires pour proposer des voies de synthèse de haute qualité. Le système intègre R-SMILES 2, un modèle de novo basé sur Transformer, avec NeuralLoc, un modèle basé sur un réseau neuronal graphique (GNN), en utilisant une stratégie d'assemblage apprise pour classer les prédictions.

lab Hugging Face Blog · il y a 1 j · 8 vues

NVIDIA publie le modèle fondamental Kumo Tabular open source pour la prédiction tabulaire en zéro-shot

NVIDIA a publié Kumo Tabular, un modèle fondamental open source pour la classification et la régression tabulaires qui fonctionne par apprentissage in-context sans nécessiter d'entraînement ni d'ingénierie des fonctionnalités. Pré-entraîné exclusivement sur des données artificielles générées par des Modèles Causaux Structurels, le modèle est disponible en trois tailles allant de 28M à 215M paramètres.

lab Hugging Face Blog · il y a 2 j OSWorld 2.0 · 61.7% · 9 vues

Holo4 : des modèles agents généralistes pour les interfaces graphiques, le code et les API

Holo4 est une nouvelle série de modèles agents de H Company, disponible en tailles 27B dense et 35B-A3B Mixture of Experts. Ces modèles interagissent avec les logiciels via n'importe quelle interface — interfaces graphiques (GUI), code, MCP ou API — et s'exécutent sur les ordinateurs de bureau, le web, Android et des environnements isolés en utilisant le même modèle.

media MarkTechPost · il y a 20 j · 55 vues

DeepSeek publie DeepSeek-V4.1-Flash avec un contexte de 1M et un cache KV FP4

DeepSeek AI a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal disposant d'une fenêtre de contexte de 1 million de tokens et d'un cache KV FP4 qui réduit l'empreinte globale du cache à 890 octets par token. Le modèle utilise une architecture encodeur-décodeur causal et Compressed Sparse Attention 2 (CSA2) pour réduire considérablement les besoins en mémoire tout en maintenant les performances.

media MarkTechPost · il y a 1 j Android World · 85.1% · 8 vues

H Company publie les modèles Holo4 à poids ouverts pour l'utilisation informatique sur bureau, web et mobile

H Company a publié Holo4, une famille de modèles vision-langage généralistes d'utilisation informatique conçus pour cliquer, taper du texte, écrire du code et appeler des outils sur les environnements de bureau, web, Android et API. La publication comprend deux tailles de modèles : Holo4 27B (dense) et Holo4 35B-A3B (Mixture of Experts avec 3B paramètres actifs), tous deux prenant en charge une fenêtre de contexte de 256K.

media MarkTechPost · il y a 1 j SWE-bench Verified · 79.0% · 7 vues

Google Research publie RRSI pour prévenir le surajustement du harnais des agents IA

Google Cloud AI Research, en collaboration avec UNC-Chapel Hill, Stanford et l'Université Washington à Saint-Louis, a open-sourcé RRSI (Regularized Recursive Self-Improvement). Ce cadre permet à un agent LLM de réécrire son propre harnais — y compris les prompts, les outils, la mémoire, le flux de contrôle et les sous-agents — sans modifier les poids du modèle.

media Hugging Face Forums · il y a 6 j GPQA Diamond · 93.94% · 22 vues

VeriLoop E2 : modèle post-entraîné de 27B avec échelle GGUF allant de BF16 à IQ1_M

Le Tsinghua SIGS Robot Lab a publié VeriLoop E2, un modèle post-entraîné de 27B basé sur Qwen3.8-27B pour le code vérifiable, les mathématiques et le raisonnement scientifique. La publication introduit la Récurrence Gouvernée par VeriLoop (VGR), qui sépare la génération de la vérification externe afin d'assurer que les transitions d'état améliorent strictement les dimensions des preuves.