AI agents
media MarkTechPost · há 14 h Berkeley Function-Calling Leaderboard · 70.94% · 3 visualizações

Pokee AI lança Pokee-Isaac 28B, um modelo de contexto de 10M de tokens para implantação em limites definidos

A Pokee AI lançou o Pokee-Isaac 28B, um modelo fundamental de texto com apenas 28B de parâmetros, apresentando uma janela de contexto de 10M de tokens projetada para operar inteiramente dentro dos limites controlados pelo cliente. O modelo está disponível por meio de uma API compatível com OpenAI e licenciado para implantação em VPCs, ambientes locais ou hardware on-device, em vez de ser open-weight.

lab Claude Code Releases · há 1 d · 8 visualizações

Claude Code v2.1.225 adiciona avisos de limite de gastos do gateway e prompts de confiança do espaço de trabalho

A Anthropic lançou a versão 2.1.225 do Claude Code, introduzindo novos avisos de uso para limites de gastos do gateway e um prompt de confiança do espaço de trabalho para diretórios não confiáveis. A atualização também corrige vários problemas de autenticação, incluindo erros transitórios 401 em sessões headless e falhas intermitentes nas leituras do chaveiro do macOS.

media MarkTechPost · há 1 d

NVIDIA lança NOOA, um framework Python orientado a objetos para construir agentes de IA

O NVIDIA Labs lançou o código-fonte aberto do NOOA (NVIDIA Object-Oriented Agents), um framework Python agnóstico a modelos que consolida o desenvolvimento de agentes em uma única classe Python. Essa abordagem substitui fluxos de trabalho fragmentados envolvendo templates de prompt e grafos de fluxo, mapeando métodos para ações, campos para estado, docstrings para prompts e anotações de tipo para contratos impostos.

lab Hugging Face Blog · há 2 d · 3 visualizações

TutorMoments avalia se tutores de IA sabem quando ajudar ou recuar

Pesquisadores apresentam o TutorMoments, uma estrutura projetada para medir se grandes modelos de linguagem podem equilibrar a troca pedagógica entre fornecer suporte e incentivar o raciocínio independente. Construído com base em transcrições reais de tutoria matemática individual, o sistema reproduz pontos de decisão para avaliar o comportamento do modelo contra um ground truth anotado por humanos.

media TLDR AI · há 2 d · 2 visualizações

Google abre o código-fonte dos modelos WeatherNext; Meta explora sinergia cross-modal

O Google abriu o código-fonte de seus modelos de IA WeatherNext 2 e WeatherNext Cyclones para melhorar a precisão da previsão de ciclones. Os modelos alcançam resultados state-of-the-art na previsão de trajetória, intensidade e estrutura do vento, fornecendo aos meteorologistas, em média, um dia extra de precisão preditiva em comparação com os métodos atuais.

lab OpenAI News · há 2 d · 4 visualizações

Anthropic pausa o desenvolvimento do Astra após avaliações internas sugerirem capacidades cibernéticas críticas

A Anthropic pausou as atividades internas envolvendo seu próximo modelo, o Astra, porque avaliações recentes indicam que ele pode possuir capacidades críticas de cibersegurança sob o Framework de Preparação da empresa. A firma não pode descartar que o modelo possa identificar e desenvolver exploits funcionais de dia zero em sistemas reais endurecidos sem intervenção humana.

media TLDR AI · há 3 d · 2 visualizações

Meta lança agente de terminal Muse Code; reestruturação na liderança do Google DeepMind

A Meta lançou o Muse Code, um agente de codificação em terminal alimentado pelo Muse Spark 1.2, projetado para lidar com tarefas de engenharia complexas em nível de repositório. Simultaneamente, o Google DeepMind anunciou mudanças significativas na liderança, com Demis Hassabis assumindo a presidência do Google DeepMind e cientista-chefe da Alphabet, enquanto Jeff Dean se despede após 27 anos.

media MarkTechPost · há 3 d · 14 visualizações

Prime Intellect lança o Prime Agent, uma estrutura RLM de código aberto com kernel IPython persistente

A Prime Intellect tornou open-source o Prime Agent, uma estrutura de codificação autoaperfeiçoável que substitui esquemas de ferramentas fixos e compactação de contexto por um REPL Python persistente e um "Continual Harness" reescrevível. O sistema trata a delegação de sub-agentes como chamadas de função dentro deste ambiente, permitindo que os modelos gerenciem seus próprios prompts, habilidades e memória.

arxiv arXiv cs.AI · há 3 d SWE-bench Pro · 78.0%

Argus: Um Runtime Agêntico de Propósito Geral para Raciocínio de Longo Prazo

Pesquisadores apresentam o Argus, um runtime agêntico persistente e autoevolutivo projetado para raciocínio de longo prazo que separa a intenção estável do usuário dos objetivos operacionais. O sistema utiliza funções de Gerente, Planejador, Engenheiro e Revisor para executar missões delimitadas sobre um estado de projeto durável, permitindo execução autônoma entre pontos de escalonamento de propriedade do operador.

media MarkTechPost · há 3 d

SkillOpt da Microsoft permite transferência de habilidades entre Codex e Claude Code

Pesquisadores da Microsoft, da Universidade Jiao Tong de Xangai, da Universidade Tongji e da Universidade Fudan desenvolveram o SkillOpt, um otimizador no espaço de texto que treina documentos de habilidade em linguagem natural enquanto mantém o modelo-alvo congelado. O sistema utiliza um modelo otimizador para propor edições limitadas com base em rollouts pontuados, exportando o resultado como um único arquivo `best_skill.md`.