Source · MarkTechPost
media MarkTechPost · il y a 1 j OSWorld 2.0 · 72.6% · 2 vues

OpenAI lance les dots : des agents GPT-6 Astra persistants avec des ordinateurs cloud dédiés

OpenAI a introduit « dots », un nouveau produit géré présentant des agents IA persistants alimentés par le modèle GPT-6 Astra. Chaque dot fonctionne sur son propre ordinateur cloud et navigateur dédiés, lui permettant de travailler sur plus de 4 000 applications via les plugins ChatGPT et de poursuivre les tâches après la déconnexion de l'utilisateur.

media MarkTechPost · il y a 8 j GDPval-AA (Elo) · 1695.0Elo · 23 vues

SpaceXAI publie Grok 4.7 avec un modèle de base plus grand et des benchmarks améliorés

SpaceXAI a publié Grok 4.7, un nouveau modèle phare pour le codage, les tâches agentices et le travail sur les connaissances, qui utilise un modèle de base plus grand et une exécution d'apprentissage par renforcement prolongée par rapport à Grok 4.6. Le modèle maintient la même structure tarifaire que son prédécesseur tout en offrant des capacités améliorées en auto-vérification, gestion du contexte long et sécurité.

media MarkTechPost · il y a 12 j · 35 vues

Alibaba Qwen publie Qwen3.8-Omni-Flash, un modèle omni-modal agentic avec une fenêtre de contexte de 1M

L'équipe Qwen d'Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle omni-modal conçu autour de capacités agentic pour la compréhension audio-vidéo et l'utilisation d'outils. Le modèle accepte des entrées textuelles, images, audio et vidéo pour retourner des sorties textuelles, avec une fenêtre de contexte de 1M tokens et un appel de fonction natif.

media MarkTechPost · il y a 17 j · 40 vues

Anthropic propose le plan « Pace the Frontier » avec des évaluateurs intégrés

Le 12 septembre 2026, Dario Amodei, PDG d'Anthropic, a publié un essai intitulé « We Must Pace the Frontier », appelant à un ralentissement des améliorations des capacités de l'IA. La proposition comprend un plan en trois étapes : la mise en place d'évaluateurs tiers intégrés avec un accès au niveau des employés aux pipelines d'entraînement, la coordination des normes de sécurité parmi les laboratoires de pointe et la poursuite d'accords mondiaux sur les limites de l'IA.

media MarkTechPost · il y a 20 j · 55 vues

DeepSeek publie DeepSeek-V4.1-Flash avec un contexte de 1M et un cache KV FP4

DeepSeek AI a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal disposant d'une fenêtre de contexte de 1 million de tokens et d'un cache KV FP4 qui réduit l'empreinte globale du cache à 890 octets par token. Le modèle utilise une architecture encodeur-décodeur causal et Compressed Sparse Attention 2 (CSA2) pour réduire considérablement les besoins en mémoire tout en maintenant les performances.

media MarkTechPost · il y a 27 j ARC-AGI 3 · 99.9% · 59 vues

OpenAI publie GPT-6 Astra, un modèle d'utilisation informatique avec une fenêtre de contexte de 1,05M

OpenAI a publié GPT-6 Astra, un modèle fermé et hébergé positionné principalement comme un système d'utilisation informatique plutôt que comme un modèle de chat. Il fait fonctionner des logiciels à travers les navigateurs, les feuilles de calcul et les terminaux pour accomplir des tâches multi-étapes, avec une fenêtre de contexte de 1 050 000 tokens et une date limite de connaissances au 30 avril 2026.

media MarkTechPost · il y a 28 j · 63 vues

Google DeepMind publie Gemini 3.8 Flash et sa variante gated Flash Cyber

Google DeepMind a publié deux nouvelles variantes de modèles, Gemini 3.8 Flash et Gemini 3.8 Flash Cyber, qui partagent une architecture fondamentale mais diffèrent par leurs périmètres de sécurité et leurs contrôles d'accès. La version standard Gemini 3.8 Flash est généralement disponible via l'API Gemini et d'autres plateformes Google, tandis que la variante Cyber est restreinte aux défenseurs vérifiés par le biais du Programme Fairwind.

media MarkTechPost · il y a 7 h

Les chercheurs de NVIDIA publient Physis-Lang pour améliorer le raisonnement physique dans les modèles vidéo Cosmos 3

Des chercheurs de NVIDIA, du MIT et de l'Université d'Oxford ont présenté Physis-Lang, un cadre qui améliore les modèles mondiaux vidéo en intégrant un langage physique auto-évolutif dans les légendes. Cette approche traite le langage physique comme une représentation optimisable utilisée pour la curation des données, l'entraînement du modèle et l'inférence afin de corriger les erreurs physiques dans les vidéos générées.

media MarkTechPost · il y a 7 h · 4 vues

Perplexity publie Photon, réduisant la latence p99 de récupération de 800 ms à 65 ms

Perplexity a publié Photon, un moteur de récupération et de classement basé sur Rust développé en interne qui gère désormais tout le trafic de production, remplaçant un composant open-source précédemment forké. Le nouveau système permet un mode « Recherche rapide » dans l'API Perplexity Search, offrant une latence nettement inférieure pour les workflows agents.

media MarkTechPost · il y a 1 j Android World · 85.1% · 8 vues

H Company publie les modèles Holo4 à poids ouverts pour l'utilisation informatique sur bureau, web et mobile

H Company a publié Holo4, une famille de modèles vision-langage généralistes d'utilisation informatique conçus pour cliquer, taper du texte, écrire du code et appeler des outils sur les environnements de bureau, web, Android et API. La publication comprend deux tailles de modèles : Holo4 27B (dense) et Holo4 35B-A3B (Mixture of Experts avec 3B paramètres actifs), tous deux prenant en charge une fenêtre de contexte de 256K.

media MarkTechPost · il y a 1 j SWE-bench Verified · 79.0% · 7 vues

Google Research publie RRSI pour prévenir le surajustement du harnais des agents IA

Google Cloud AI Research, en collaboration avec UNC-Chapel Hill, Stanford et l'Université Washington à Saint-Louis, a open-sourcé RRSI (Regularized Recursive Self-Improvement). Ce cadre permet à un agent LLM de réécrire son propre harnais — y compris les prompts, les outils, la mémoire, le flux de contrôle et les sous-agents — sans modifier les poids du modèle.

media MarkTechPost · il y a 2 j · 9 vues

NVIDIA lance la Plateforme de Sécurité des Agents Ouverts avec OpenShell et Sentry

NVIDIA a lancé la Plateforme de Sécurité des Agents Ouverts NVIDIA, une plateforme logicielle ouverte pour la sécurité des agents IA qui associe le runtime sécurisé OpenShell à Sentry, un gardien hors bande sur les DPUs BlueField-4. Le système est conçu pour empêcher la « dérive », un mode de défaillance où les agents contournent les contrôles au niveau applicatif, en plaçant l'application des mesures de sécurité hors de portée de l'agent.