AI agents
media MarkTechPost · il y a 14 h Berkeley Function-Calling Leaderboard · 70.94% · 3 vues

Pokee AI publie Pokee-Isaac 28B, un modèle de contexte de 10M de tokens pour un déploiement en périmètre fermé

Pokee AI a publié Pokee-Isaac 28B, un modèle fondamental textuel uniquement de 28 milliards de paramètres doté d'une fenêtre de contexte de 10 millions de tokens, conçu pour fonctionner entièrement dans des limites contrôlées par le client. Le modèle est disponible via une API compatible OpenAI et est licencié pour un déploiement dans des VPC, des environnements sur site ou sur du matériel embarqué, plutôt que d'être à poids ouverts.

lab Claude Code Releases · il y a 1 j · 8 vues

Claude Code v2.1.225 ajoute des avertissements de limite de dépenses pour les passerelles et des invites de confiance d'espace de travail

Anthropic a publié la version 2.1.225 de Claude Code, introduisant de nouveaux avertissements d'utilisation pour les limites de dépenses des passerelles et une invite de confiance d'espace de travail pour les répertoires non approuvés. La mise à jour résout également plusieurs problèmes d'authentification, notamment des erreurs 401 transitoires dans les sessions headless et des échecs intermittents lors de la lecture du trousseau macOS.

media MarkTechPost · il y a 1 j

NVIDIA lance NOOA, un framework Python orienté objet pour créer des agents IA

NVIDIA Labs a open-sourcé NOOA (NVIDIA Object-Oriented Agents), un framework Python indépendant du modèle qui centralise le développement d'agents en une seule classe Python. Cette approche remplace les flux de travail fragmentés impliquant des modèles de prompts et des graphes de workflow en mappant les méthodes aux actions, les champs à l'état, les docstrings aux prompts et les annotations de type aux contrats imposés.

lab Hugging Face Blog · il y a 2 j · 3 vues

TutorMoments évalue si les tuteurs IA savent quand aider ou se retenir

Les chercheurs présentent TutorMoments, un cadre conçu pour mesurer si les grands modèles de langage peuvent équilibrer le compromis pédagogique entre fournir un soutien et encourager la réflexion autonome. Basé sur des transcriptions réelles de tutorats individuels en mathématiques, le système rejoue les points de décision pour évaluer le comportement du modèle par rapport à une vérité terrain annotée par des humains.

media TLDR AI · il y a 2 j · 2 vues

Google open-source les modèles WeatherNext ; Meta explore la synergie cross-modal

Google a open-sourcé ses modèles d'IA WeatherNext 2 et WeatherNext Cyclones pour améliorer la précision des prévisions de cyclones. Les modèles atteignent des résultats state-of-the-art dans la prédiction de la trajectoire, de l'intensité et de la structure du vent, offrant aux météorologues en moyenne un jour supplémentaire de précision prédictive par rapport aux méthodes actuelles.

lab OpenAI News · il y a 2 j · 4 vues

Anthropic suspend le développement d'Astra après des évaluations internes suggérant des capacités cyber critiques

Anthropic a suspendu les activités internes impliquant son prochain modèle, Astra, car des évaluations récentes indiquent qu'il pourrait posséder des capacités critiques de cybersécurité selon le Cadre de Préparation de l'entreprise. La firme ne peut exclure que le modèle puisse identifier et développer des exploits fonctionnels de jour zéro dans des systèmes réels durcis sans intervention humaine.

media AI News (smol.ai) · il y a 2 j

Mises à jour de Muse Spark 1.2 de Meta et GPT-5.6 Sol d'OpenAI

Meta a annoncé que son modèle Muse Spark 1.2 a obtenu des performances de niveau médaille d'or dans cinq olympiades STEM et s'est classé parmi les cinq premiers de l'indice Vals à 0,69 $/test, soit environ 3 fois moins cher que Kimi. Meta attribue ces progrès à l'orchestration multi-agents avec raisonnement parallèle, notant des scores théoriques parfaits aux APhO et IPhO sans outils externes.

media TLDR AI · il y a 3 j · 2 vues

Meta lance l'agent terminal Muse Code ; remaniement de la direction chez Google DeepMind

Meta a publié Muse Code, un agent de codage terminal alimenté par Muse Spark 1.2 conçu pour gérer des tâches d'ingénierie complexes au niveau du dépôt. Parallèlement, Google DeepMind a annoncé des changements significatifs dans sa direction, avec Demis Hassabis qui devient président de Google DeepMind et scientifique en chef d'Alphabet, tandis que Jeff Dean quitte l'entreprise après 27 ans.

media MarkTechPost · il y a 3 j · 14 vues

Prime Intellect publie Prime Agent, un cadre RLM open-source avec noyau IPython persistant

Prime Intellect a ouvert le code source de Prime Agent, un cadre d'amélioration continue pour la programmation qui remplace les schémas d'outils fixes et la compaction du contexte par un REPL Python persistant et un « Continual Harness » réinscriptible. Le système traite la délégation aux sous-agents comme des appels de fonctions au sein de cet environnement, permettant aux modèles de gérer leurs propres invites, compétences et mémoire.

arxiv arXiv cs.AI · il y a 3 j SWE-bench Pro · 78.0%

Argus : un runtime agentique polyvalent pour le raisonnement à long terme

Les chercheurs présentent Argus, un runtime agentique persistant et auto-évolutif conçu pour le raisonnement à long terme qui sépare l'intention utilisateur stable des objectifs opérationnels. Le système utilise les rôles Manager, Planner, Engineer et Reviewer pour exécuter des missions bornées sur un état de projet durable, permettant une exécution autonome entre les points d'escalade détenus par l'opérateur.

media MarkTechPost · il y a 3 j

SkillOpt de Microsoft permet le transfert de compétences d'agent entre Codex et Claude Code

Des chercheurs de Microsoft, de l'Université Jiao Tong de Shanghai, de l'Université Tongji et de l'Université Fudan ont développé SkillOpt, un optimiseur dans l'espace textuel qui entraîne des documents de compétences en langage naturel tout en maintenant le modèle cible figé. Le système utilise un modèle d'optimisation pour proposer des modifications bornées basées sur des rollouts notés, exportant le résultat sous forme d'un seul fichier `best_skill.md`.