AI agents
arxiv arXiv cs.AI · há 3 h WebArena · 45.3% · 13 visualizações

Growing Harness transforma o controle recorrente de agentes em código reutilizável por meio de treinamento guiado por falhas

Os autores apresentam o Growing Harness, um paradigma de treinamento que aprende a estrutura de controle de um agente a partir do feedback da tarefa, em vez de depender de harnesses padrão com grande carga contextual. Ao converter decisões de controle recorrentes em código executável e reservar chamadas de LLM para raciocínio semântico, o método visa criar agentes especialistas reutilizáveis.

arxiv arXiv cs.AI · há 4 h · 9 visualizações

CliffCompaction reduz custos de agentes de codificação em 50% mantendo o desempenho

Pesquisadores apresentam o CliffCompaction, uma técnica de autocompactação projetada para reduzir custos para agentes de codificação de longo alcance em até 50% sob um contexto limitado. O método mantém ou melhora o desempenho no Terminal-Bench e alcança resultados de estado da arte no KernelBench ao manter as informações compactadas fiéis por meio de truncamento em vez de reformulação.

arxiv arXiv cs.LG · há 4 h · 11 visualizações

AIDE^2 permite autoaperfeiçoamento recursivo de agentes de pesquisa com IA

Pesquisadores apresentam o AIDE^2, um sistema que implementa um ciclo de autoaperfeiçoamento recursivo para um agente de pesquisa de IA de ponta, otimizando seu próprio código. O sistema propõe alterações em sua lógica interna, avalia versões modificadas em tarefas de P&D de IA e retém apenas as atualizações que obtêm o melhor desempenho em avaliações ocultas.

arxiv arXiv cs.LG · há 5 h · 9 visualizações

CliffCompaction reduz os custos de agentes de codificação de longo alcance em até 50% mantendo o desempenho

Pesquisadores apresentam o CliffCompaction, uma técnica de autocompactação projetada para agentes que lidam com milhões de tokens, que corta custos em até 50% sob contexto limitado. O método mantém ou melhora o desempenho no Terminal-Bench e alcança resultados de estado da arte no KernelBench ao manter a fidelidade das informações por meio de truncamento em vez de reformulação.

lab xAI News · há 10 h · 15 visualizações

SpaceXAI usa o Grok Bot para lidar com aumento de 175% nos tickets sem contratar

A SpaceXAI integrou seu agente de IA Grok Bot em sua operação combinada de suporte ao cliente após a aquisição da Cursor, permitindo que a equipe gerencie um aumento de 175% nos tickets de suporte sem adicionar funcionários. A empresa evitou contratar aproximadamente 200 membros adicionais e reduziu os custos de resolução para entre US$ 0,20 e US$ 0,30 por ticket ao aproveitar o modelo de precificação baseado no uso do Grok Bot.

lab OpenAI News · há 13 h · 22 visualizações

OpenAI melhora o cache de prompts do GPT-6 com maiores taxas de acerto e diagnósticos

A OpenAI lançou um sistema aprimorado de cache de prompts para a família GPT-6 que oferece, por padrão, maiores taxas de acerto no cache e concede descontos de até 90% nos tokens de entrada em cache. A atualização introduz novas ferramentas para ajudar os desenvolvedores a monitorar o desempenho, diagnosticar falhas de cache e otimizar suas integrações.

media Hugging Face Forums · há 1 d · 10 visualizações

Restrição distribuída em IA multiagente governa agentes sem identidade coletiva

Uma nova análise destaca um fenômeno em sistemas multiagente onde relações geradas entre agentes governados separadamente adquirem força de governança em todo o grupo. Isso ocorre quando os agentes deixam mensagens e artefatos persistentes que restringem as trajetórias uns dos outros, criando uma orientação distribuída efetiva não especificada por tarefas individuais.

arxiv arXiv cs.AI · há 1 d · 9 visualizações

AgentRouter reduz custos de fluxos de trabalho agênticos em 72% por meio de roteamento de modelos em nível de etapa

Pesquisadores propõem o AgentRouter, um classificador leve que otimiza fluxos de trabalho agênticos multi-etapas ao rotear etapas individuais da trajetória para níveis apropriados de modelo, em vez de usar modelos de fronteira para cada tarefa. O sistema aborda a ineficiência das soluções existentes que ignoram a complexidade variada de subtarefas dentro de uma única sessão de agente.