Fonte · MarkTechPost
media MarkTechPost · há 1 d OSWorld 2.0 · 72.6% · 2 visualizações

OpenAI lança dots: agentes persistentes do GPT-6 Astra com computadores em nuvem dedicados

A OpenAI apresentou os "dots", um novo produto gerenciado que apresenta agentes de IA persistentes alimentados pelo modelo GPT-6 Astra. Cada dot opera em seu próprio computador em nuvem dedicado e navegador, permitindo que trabalhe em mais de 4.000 aplicativos por meio de plugins do ChatGPT e continue as tarefas após o usuário fazer logout.

media MarkTechPost · há 8 d GDPval-AA (Elo) · 1695.0Elo · 23 visualizações

SpaceXAI lança Grok 4.7 com modelo base maior e benchmarks aprimorados

A SpaceXAI lançou o Grok 4.7, um novo modelo principal para codificação, tarefas agênticas e trabalho de conhecimento que utiliza um modelo base maior e uma execução de aprendizado por reforço estendida em comparação ao Grok 4.6. O modelo mantém a mesma estrutura de preços do seu antecessor, enquanto oferece capacidades aprimoradas de autoverificação, manipulação de contexto longo e segurança.

media MarkTechPost · há 12 d · 35 visualizações

Alibaba Qwen lança Qwen3.8-Omni-Flash, um modelo omni-modal agêntico com contexto de 1M

A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal projetado em torno de capacidades agênticas para compreensão áudio-vídeo e uso de ferramentas. O modelo aceita entradas de texto, imagens, áudio e vídeo para retornar saídas de texto, apresentando uma janela de contexto de 1M de tokens e chamada nativa de funções.

media MarkTechPost · há 17 d · 40 visualizações

Anthropic propõe plano 'Pace the Frontier' com avaliadores embutidos

Em 12 de setembro de 2026, o CEO da Anthropic, Dario Amodei, publicou um ensaio intitulado 'We Must Pace the Frontier', pedindo uma desaceleração nas melhorias das capacidades de IA. A proposta inclui um plano em três etapas: estabelecer "avaliadores embutidos" de terceiros com acesso ao nível de funcionário aos pipelines de treinamento, coordenar padrões de segurança entre laboratórios de fronteira e buscar acordos globais sobre limites de IA.

media MarkTechPost · há 20 d · 55 visualizações

DeepSeek lança DeepSeek-V4.1-Flash com contexto de 1M e cache KV FP4

A DeepSeek AI lançou o DeepSeek-V4.1-Flash, um modelo Mixture-of-Experts multimodal que possui uma janela de contexto de 1 milhão de tokens e um cache KV FP4 que reduz a pegada global do cache para 890 bytes por token. O modelo utiliza uma arquitetura de codificador-decodificador causal e Compressed Sparse Attention 2 (CSA2) para reduzir significativamente os requisitos de memória enquanto mantém o desempenho.

media MarkTechPost · há 27 d ARC-AGI 3 · 99.9% · 59 visualizações

OpenAI lança GPT-6 Astra, um modelo de uso computacional com contexto de 1,05M

A OpenAI lançou o GPT-6 Astra, um modelo fechado e hospedado posicionado principalmente como um sistema de uso computacional em vez de um modelo de chat. Ele opera software em navegadores, planilhas e terminais para concluir tarefas em múltiplos passos, apresentando uma janela de contexto de 1.050.000 tokens e um corte de conhecimento em 30 de abril de 2026.

media MarkTechPost · há 28 d · 63 visualizações

Google DeepMind lança Gemini 3.8 Flash e variante gated Flash Cyber

O Google DeepMind lançou duas novas variantes de modelo, Gemini 3.8 Flash e Gemini 3.8 Flash Cyber, que compartilham uma arquitetura fundamental, mas diferem nos envelopes de segurança e controles de acesso. O Gemini 3.8 Flash padrão está geralmente disponível por meio da API Gemini e outras plataformas do Google, enquanto a variante Cyber é restrita a defensores avaliados por meio do Programa Fairwind.

media MarkTechPost · há 7 h

Pesquisadores da NVIDIA lançam Physis-Lang para melhorar o raciocínio físico nos modelos de vídeo Cosmos 3

Pesquisadores da NVIDIA, MIT e da Universidade de Oxford apresentaram o Physis-Lang, um framework que aprimora os modelos de mundo em vídeo ao integrar linguagem física autoevolutiva nas legendas. Essa abordagem trata a linguagem física como uma representação otimizável usada para curadoria de dados, treinamento do modelo e inferência, corrigindo erros físicos nos vídeos gerados.

media MarkTechPost · há 7 h · 4 visualizações

Perplexity lança Photon, reduzindo latência p99 de recuperação de 800 ms para 65 ms

A Perplexity lançou o Photon, um mecanismo de recuperação e classificação interno baseado em Rust que agora gerencia todo o tráfego de produção, substituindo um componente open-source anteriormente bifurcado. O novo sistema permite um modo de "Busca Rápida" na API de Busca da Perplexity, oferecendo latência significativamente menor para fluxos de trabalho agênticos.

media MarkTechPost · há 1 d Android World · 85.1% · 8 visualizações

H Company lança modelos de uso de computador Holo4 de peso aberto para desktop, web e mobile

A H Company lançou o Holo4, uma família de modelos de visão e linguagem generalistas para uso de computador, projetados para clicar, digitar, escrever código e chamar ferramentas em ambientes de desktop, web, Android e API. O lançamento inclui dois tamanhos de modelo: Holo4 27B (denso) e Holo4 35B-A3B (Mixture of Experts com 3B parâmetros ativos), ambos suportando uma janela de contexto de 256K.

media MarkTechPost · há 1 d SWE-bench Verified · 79.0% · 7 visualizações

Google Research lança RRSI para evitar overfitting em harness de agentes de IA

A Google Cloud AI Research, em colaboração com UNC-Chapel Hill, Stanford e Washington University in St. Louis, tornou open-source o RRSI (Regularized Recursive Self-Improvement). Este framework permite que um agente LLM reescreva seu próprio harness — incluindo prompts, ferramentas, memória, fluxo de controle e sub-agentes — sem alterar os pesos do modelo.

media MarkTechPost · há 2 d · 9 visualizações

NVIDIA lança Plataforma de Segurança para Agentes Abertos com OpenShell e Sentry

A NVIDIA lançou a Plataforma de Segurança para Agentes Abertos da NVIDIA, uma plataforma de software aberta para segurança de agentes de IA que combina o tempo de execução seguro OpenShell com o Sentry, um watchdog fora de banda nos BlueField-4 DPUs. O sistema foi projetado para prevenir "drift", um modo de falha em que os agentes contornam os controles da camada de aplicação, ao colocar a aplicação de segurança fora do alcance do agente.