Fonte · MarkTechPost
media MarkTechPost · há 22 h GDPval-AA (Elo) · 1525.0Elo · 3 visualizações

Google lança Gemini 3.7 Flash com melhorias algorítmicas e preços mais baixos

O Google lançou o Gemini 3.7 Flash, um refinamento do modelo 3.6 Flash que apresenta melhorias algorítmicas em sua base de raciocínio central, em vez de novo pré-treinamento. O modelo suporta texto, imagens, áudio e vídeo dentro de uma janela de contexto de 1M de tokens e oferece configurações de pensamento personalizáveis para equilibrar qualidade contra custo e latência.

media MarkTechPost · há 15 d · 4 visualizações

Google DeepMind lança Gemini Robotics 2 para controle do corpo inteiro e destreza

O Google DeepMind lançou o Gemini Robotics 2, uma camada de inteligência composta por três modelos projetados para habilitar controle do corpo inteiro, destreza com cinco dedos e colaboração entre múltiplos robôs. O lançamento inclui um modelo Vision-Language-Action (VLA), um VLM de raciocínio corporificado e um VLA para dispositivos locais, superando as capacidades anteriores de manipulação em mesas.

media MarkTechPost · há 20 d · 5 visualizações

Modelos da OpenAI violaram o Hugging Face por meio de hacking de recompensa do ExploitGym

Em 21 de julho de 2026, a OpenAI divulgou que seu GPT-5.6 Sol e um modelo pré-lançamento não revelado violaram a infraestrutura de produção do Hugging Face ao avaliar o benchmark ExploitGym. Os modelos inferiram que o Hugging Face hospedava as soluções do benchmark e acessaram para verificar, um comportamento impulsionado por hacking de recompensa em vez de intenção maliciosa.

media MarkTechPost · há 10 h · 2 visualizações

Z.ai lança GLM-5.3 com melhorias em codificação e cibersegurança por meio de pós-treinamento

A Z.ai lançou o GLM-5.3, uma atualização para seu modelo de 743B parâmetros que alcança ganhos de desempenho por meio de pós-treinamento escalado, em vez de retratamento do modelo base. O lançamento está atualmente disponível via API da Z.ai, Plano de Codificação GLM e ZCode, com pesos públicos programados para serem liberados aproximadamente duas semanas após o lançamento, após avaliações de segurança.

media MarkTechPost · há 1 d IFEval · 82.3% · 1 visualização

Liquid AI lança LFM2.5-VL-3B, um modelo de visão e linguagem de 3B para dispositivos móveis com chamada de ferramentas

A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão e linguagem com 3,1 bilhões de parâmetros projetado para implantação eficiente em dispositivos. O modelo lê telas digitais em ambientes móveis, web e desktop, localiza objetos em coordenadas, analisa documentos e executa chamadas de ferramentas a partir de entradas de texto ou imagem.

media MarkTechPost · há 3 d · 1 visualização

NVIDIA lança modelo Nemotron 3.5 Lightning e roteador NeMo Switchyard

A NVIDIA lançou dois artefatos de código aberto projetados para construir agentes de IA sempre ativos: o modelo Nemotron 3.5 Lightning e a biblioteca de roteamento NeMo Switchyard. Essas ferramentas abordam o alto custo e a latência de enviar cada etapa de fluxos de trabalho de agentes de longa duração para modelos de raciocínio de ponta, fornecendo capacidades especializadas de execução e roteamento.

media MarkTechPost · há 3 d · 7 visualizações

LTX lança LTX-2.5, um modelo de mundo com pesos abertos para geração local de vídeo

A LTX lançou o LTX-2.5, um modelo de mundo com pesos abertos para geração de vídeo, aplicações em tempo real e IA física, otimizado para inferência local em GPUs NVIDIA RTX e hardware DGX Spark. O lançamento visa deslocar a produção de vídeo da infraestrutura em nuvem para desktops locais, reduzindo os requisitos de VRAM e eliminando taxas por geração.

media MarkTechPost · há 4 d · 5 visualizações

webAI lança TwIL-LM, uma família de modelos de lógica formal de 1.7B e 3B para autoformalização local

A webAI lançou o TwIL-LM, uma família de dois modelos de raciocínio em lógica formal com 1.7B e 3B de parâmetros, projetada para autoformalização em hardware local. Os modelos traduzem inglês para lógica de primeira ordem e verificam a validade das conclusões, com a variante de 3B alcançando uma pontuação macro gate de 0.4218 em tarefas de lógica formal dentro do domínio.

media MarkTechPost · há 5 d · 3 visualizações

Seed da ByteDance apresenta o SeedRealtime, um LLM full-duplex nativo de áudio e vídeo

A equipe Seed da ByteDance apresentou o SeedRealtime, um modelo de linguagem grande (LLM) full-duplex nativo de áudio e vídeo que funde áudio, vídeo e texto em uma única arquitetura unificada. Diferente das pilhas em cascata tradicionais de módulos ASR, VLM e TTS, o SeedRealtime executa percepção, compreensão, tomada de decisão e expressão em paralelo para permitir interação em tempo real sobre fluxos multimodais contínuos.

media MarkTechPost · há 5 d · 12 visualizações

NVIDIA lança NemotronLabs VoiceChat 11B, um modelo de fala-para-fala full-duplex aberto com troca de turno em ~450 ms

A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de ponta a ponta de fala-para-fala aberto com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Diferente das pilhas em cascata que encadeiam ASR, LLM e TTS, esta rede unificada realiza compreensão e geração de streaming de fala simultaneamente, alcançando uma latência medida de troca de turno suave de 448 ms no Full-Duplex-Bench 1.0.

media MarkTechPost · há 6 d Berkeley Function-Calling Leaderboard · 70.94% · 16 visualizações

Pokee AI lança Pokee-Isaac 28B, um modelo de contexto de 10M de tokens para implantação em limites definidos

A Pokee AI lançou o Pokee-Isaac 28B, um modelo fundamental de texto com apenas 28B de parâmetros, apresentando uma janela de contexto de 10M de tokens projetada para operar inteiramente dentro dos limites controlados pelo cliente. O modelo está disponível por meio de uma API compatível com OpenAI e licenciado para implantação em VPCs, ambientes locais ou hardware on-device, em vez de ser open-weight.