Sujet · Benchmark results
lab NVIDIA Research · il y a 19 j · 21 vues

ReasoningBomb provoque un raisonnement pathologiquement long dans les grands modèles de raisonnement

Des chercheurs ont formalisé des attaques par déni de service au moment de l'inférence (PI-DoS) qui exploitent le coût computationnel élevé du raisonnement explicite multi-étapes dans les Grands Modèles de Raisonnement (LRMs). Ils présentent ReasoningBomb, un cadre basé sur l'apprentissage par renforcement qui entraîne un attaquant à générer des invites naturelles courtes qui poussent les modèles victimes vers des traces de raisonnement pathologiquement longues et souvent non terminantes.

lab Hugging Face Blog · il y a 1 j · 8 vues

NVIDIA publie le modèle fondamental Kumo Tabular open source pour la prédiction tabulaire en zéro-shot

NVIDIA a publié Kumo Tabular, un modèle fondamental open source pour la classification et la régression tabulaires qui fonctionne par apprentissage in-context sans nécessiter d'entraînement ni d'ingénierie des fonctionnalités. Pré-entraîné exclusivement sur des données artificielles générées par des Modèles Causaux Structurels, le modèle est disponible en trois tailles allant de 28M à 215M paramètres.

media The Batch · il y a 5 j Humanity's Last Exam · 61.4% · 11 vues

Anthropic publie Claude Opus 5.5 ; TypeSafe lance le modèle de classification Jev

Anthropic a publié Claude Opus 5.5, un successeur moins coûteux à Claude Opus 5 qui domine l'Intelligence Index v4.3 d'Artificial Analysis et le Vals Index de Vals AI dans les benchmarks d'intelligence globale. Parallèlement, TypeSafe, fondée par l'ancien d'OpenAI Diogo Almeida, a présenté Jev, un modèle de classification générale conçu pour analyser du texte et retourner des sorties prédéfinies à un coût inférieur à celui des grands modèles de langage.

media MarkTechPost · il y a 8 j GDPval-AA (Elo) · 1695.0Elo · 23 vues

SpaceXAI publie Grok 4.7 avec un modèle de base plus grand et des benchmarks améliorés

SpaceXAI a publié Grok 4.7, un nouveau modèle phare pour le codage, les tâches agentices et le travail sur les connaissances, qui utilise un modèle de base plus grand et une exécution d'apprentissage par renforcement prolongée par rapport à Grok 4.6. Le modèle maintient la même structure tarifaire que son prédécesseur tout en offrant des capacités améliorées en auto-vérification, gestion du contexte long et sécurité.

media The Batch · il y a 19 j GPQA Diamond · 96.3% · 32 vues

OpenAI lance GPT-6 Astra, domine les classements avec un coût réduit

OpenAI a publié GPT-6 Astra, son nouveau modèle phare vision-langue qui atteint des classements de premier ou deuxième rang sur les principaux classements d'IA tout en utilisant significativement moins de tokens et en coûtant moins que les modèles concurrents. Le modèle est conçu pour répondre au niveau critique de cybersécurité d'OpenAI, avec des capacités cyber avancées restreintes à des organisations sélectionnées.

media AI News (smol.ai) · il y a 29 j · 50 vues

Anthropic lance Claude Fable 5.1 et Mythos 5.1 avec une tarification de cache réduite

Anthropic a publié Claude Fable 5.1 et Claude Mythos 5.1 en tant que ses nouveaux modèles phares pour la programmation et le travail sur les connaissances, les positionnant comme capables d'exécuter des tâches autonomes et multi-étapes. La mise à jour inclut une réduction significative du prix de lecture du cache à 0,25 $ par million de tokens, ainsi qu'une fenêtre de contexte de 1 million de tokens.

media MarkTechPost · il y a 6 h

Les chercheurs de NVIDIA publient Physis-Lang pour améliorer le raisonnement physique dans les modèles vidéo Cosmos 3

Des chercheurs de NVIDIA, du MIT et de l'Université d'Oxford ont présenté Physis-Lang, un cadre qui améliore les modèles mondiaux vidéo en intégrant un langage physique auto-évolutif dans les légendes. Cette approche traite le langage physique comme une représentation optimisable utilisée pour la curation des données, l'entraînement du modèle et l'inférence afin de corriger les erreurs physiques dans les vidéos générées.

media Hugging Face Forums · il y a 9 h

AI Compute Radar classe Alibaba Qwen et Google parmi les meilleurs laboratoires de modèles ouverts selon le Heat Score

AI Compute Radar a publié un tableau de classement classant 15 laboratoires qui contribuent à son ensemble suivi de 46 modèles open source, en utilisant une métrique composite appelée Heat Score. Le classement est déterminé par le nombre de modèles que chaque laboratoire possède dans le top 10, les égalités étant départagées par la meilleure position et le total des téléchargements sur 30 jours.