AI agents
media TLDR AI · il y a 2 h · 10 vues

Xiaomi open-source les modèles omnimodaux MiMo-V2.6 Pro et Flash

Xiaomi a open-sourcé les modèles omnimodaux MiMo-V2.6 Pro et Flash, conçus pour coordonner des agents afin de construire et tester visuellement des scènes 3D interactives. Ces modèles peuvent générer des actifs Blender, contrôler des bras robotiques à partir de flux vidéo, produire des frontends et des présentations, assembler des vidéos et composer de la musique sous forme de partitions et de MIDI.

arxiv arXiv cs.AI · il y a 2 h · 9 vues

AIDE^2 permet l'amélioration récursive de soi des agents de recherche en IA

Les chercheurs présentent AIDE^2, un système qui implémente une boucle d'amélioration récursive de soi pour un agent de recherche en IA en optimisant son propre code. Le système propose des modifications à sa logique interne, évalue les versions modifiées sur des tâches de R&D en IA, et ne conserve que les améliorations qui obtiennent les meilleurs résultats sur des évaluations cachées.

arxiv arXiv cs.AI · il y a 3 h WebArena · 45.3% · 13 vues

Growing Harness transforme le contrôle récurrent des agents en code réutilisable grâce à un apprentissage guidé par les échecs

Les auteurs présentent Growing Harness, un paradigme d'entraînement qui apprend la structure de contrôle d'un agent à partir du feedback de la tâche plutôt que de s'appuyer sur des harnesses standard lourdes en contexte. En convertissant les décisions de contrôle récurrentes en code exécutable et en réservant les appels LLM au raisonnement sémantique, la méthode vise à créer des agents spécialistes réutilisables.

arxiv arXiv cs.AI · il y a 4 h · 9 vues

CliffCompaction réduit de 50 % les coûts des agents de codage tout en maintenant la performance

Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour réduire les coûts des agents de codage à long terme jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore la performance sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant une information compacte fidèle par troncature plutôt que par reformulation.

arxiv arXiv cs.LG · il y a 4 h · 11 vues

AIDE^2 permet l'amélioration récursive de soi des agents de recherche en IA

Les chercheurs présentent AIDE^2, un système qui met en œuvre une boucle d'amélioration récursive de soi pour un agent de recherche en IA de pointe en optimisant son propre code. Le système propose des modifications à sa logique interne, évalue les versions modifiées sur des tâches de R&D en IA, et ne conserve que les mises à jour qui obtiennent les meilleurs résultats sur des évaluations cachées.

arxiv arXiv cs.LG · il y a 5 h · 9 vues

CliffCompaction réduit les coûts des agents de codage à long terme jusqu'à 50 % tout en maintenant les performances

Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour les agents traitant des millions de tokens, qui réduit les coûts jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore les performances sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant la fidélité de l'information par troncature plutôt que par reformulation.

lab xAI News · il y a 10 h · 15 vues

SpaceXAI utilise Grok Bot pour gérer une augmentation de 175 % des tickets sans embaucher

SpaceXAI a intégré son agent IA Grok Bot dans son service client combiné suite à l'acquisition de Cursor, permettant à l'équipe de gérer une augmentation de 175 % des tickets de support sans augmenter les effectifs. L'entreprise a évité d'embaucher environ 200 collaborateurs supplémentaires et a réduit les coûts de résolution entre 0,20 $ et 0,30 $ par ticket en tirant parti du modèle de tarification à l'usage de Grok Bot.

lab OpenAI News · il y a 13 h · 22 vues

OpenAI améliore la mise en cache des invites de GPT-6 avec des taux de succès plus élevés et des outils de diagnostic

OpenAI a lancé un système amélioré de mise en cache des invites pour la famille GPT-6 qui offre par défaut des taux de succès en cache plus élevés et propose des réductions allant jusqu'à 90 % sur les tokens d'entrée mis en cache. Cette mise à jour introduit de nouveaux outils pour aider les développeurs à surveiller les performances, diagnostiquer les échecs de cache et optimiser leurs intégrations.

arxiv arXiv cs.AI · il y a 22 h · 11 vues

Le Générateur d'État du Monde aligne les plans avec des mondes synthétiques pour améliorer le succès de l'agent

Le Générateur d'État du Monde (WSG) est un modèle qui maintient les plans des agents linguistiques alignés sur les règles de leur environnement d'exécution en réécrivant les états après des échecs. Il est entraîné sur 226K trajectoires extraites de sept domaines synthétiques où un programme applique des règles et vérifie l'atteignabilité de l'objectif.

media Hugging Face Forums · il y a 1 j · 10 vues

La contrainte distribuée dans l'IA multi-agents gouverne les agents sans identité collective

Une nouvelle analyse met en lumière un phénomène dans les systèmes multi-agents où les relations générées entre des agents gouvernés séparément acquièrent une force de gouvernance à travers le groupe. Cela se produit lorsque les agents laissent des messages et des artefacts persistants qui contraignent les trajectoires les uns des autres, créant une orientation distribuée effective non spécifiée par des tâches individuelles.

arxiv arXiv cs.AI · il y a 1 j · 9 vues

AgentRouter réduit les coûts des workflows agents de 72 % grâce au routage modèle par étape

Les chercheurs proposent AgentRouter, un classificateur léger qui optimise les workflows agents multi-étapes en acheminant les étapes individuelles de la trajectoire vers des niveaux de modèles appropriés plutôt que d'utiliser des modèles de pointe pour chaque tâche. Le système répond à l'inefficacité des solutions existantes qui ignorent la complexité variable des sous-tâches au sein d'une seule session agent.