Laboratório · Zhipu AI
media MarkTechPost · há 11 h · 2 visualizações

Z.ai lança GLM-5.3 com melhorias em codificação e cibersegurança por meio de pós-treinamento

A Z.ai lançou o GLM-5.3, uma atualização para seu modelo de 743B parâmetros que alcança ganhos de desempenho por meio de pós-treinamento escalado, em vez de retratamento do modelo base. O lançamento está atualmente disponível via API da Z.ai, Plano de Codificação GLM e ZCode, com pesos públicos programados para serem liberados aproximadamente duas semanas após o lançamento, após avaliações de segurança.

arxiv arXiv cs.LG · há 2 d HealthBench · 51.9% · 5 visualizações

Sistema RAG clínico VITA iguala ou supera LLMs de ponta no HealthBench

Um sistema de geração aumentada por recuperação (RAG) feito sob medida chamado VITA, projetado para ambientes de baixa e média renda, foi avaliado contra modelos de linguagem grandes de propósito geral no benchmark HealthBench. Em 4.023 perguntas avaliadas por um juiz GPT-4.1, o VITA ficou em primeiro lugar com 51,9% dos pontos possíveis da rubrica, superando GPT-5.4, o4-mini, Gemini 3.1 Pro e Claude Sonnet 4.6.

arxiv arXiv cs.LG · há 4 d · 2 visualizações

Macaron-V1 apresenta família de modelos de agente aberta com Mixture-of-LoRA para aprendizado contínuo

O Macaron-V1 é uma família de modelos de agente aberta projetada para inteligência experiencial, permitindo aprendizado a partir de ambientes reais e continuidade do aprendizado após a implantação. O sistema foca em dois objetivos: adaptação por meio da melhoria recursiva dos pares modelo-arreio e colaboração via arquitetura Mixture-of-LoRA (MoL) que seleciona adaptadores LoRA especialistas por turno do usuário.

arxiv arXiv cs.CL · há 4 d · 10 visualizações

Macaron-V1 apresenta família aberta de modelos de agente com Mixture-of-LoRA para aprendizado contínuo

O Macaron-V1 é uma família aberta de modelos de agente projetada para inteligência experiencial, permitindo que sistemas aprendam com experiências do mundo real e continuem a melhorar após a implantação. A arquitetura se concentra em dois objetivos: adaptação por meio da autoaperfeiçoamento recursivo dos pares modelo-arneio, e colaboração por meio de um sistema Mixture-of-LoRA (MoL) que seleciona adaptadores especialistas por turno do usuário.

arxiv arXiv cs.CL · há 15 d · 3 visualizações

OSReward introduz avaliação padronizada para modelos de recompensa de uso de computador entre plataformas

Pesquisadores apresentam o OSReward, um benchmark realista projetado para avaliar a confiabilidade de modelos de visão e linguagem (VLMs) atuando como juízes para trajetórias de agentes que utilizam computadores. O estudo revela que mesmo os VLMs mais avançados sofrem com viés sistemático de indulgência e são frequentemente caros demais para escala, enquanto modelos abertos acessíveis têm desempenho ruim.

media TLDR AI · há 16 d · 34 visualizações

xAI lança o Modo Build; pesquisadores pedem pacto de desaceleração da IA

A xAI lançou o "Modo Build" para assinantes do SuperGrok Heavy, permitindo que os usuários gerem, editem, visualizem e publiquem sites, aplicativos, jogos e painéis diretamente pelo chat, sem necessidade de configuração. Simultaneamente, mais de mil funcionários de empresas de IA de ponta assinaram uma declaração solicitando que o governo dos EUA apoie um esforço internacional para desenvolver ferramentas que delimere intencionalmente o ritmo do desenvolvimento da IA automatizada.

arxiv arXiv cs.CL · há 18 d · 3 visualizações

PIVOT compartilha varreduras de prefixo entre grupos de consulta para acelerar a atenção esparsa em nível de token

O PIVOT (Proxy Indexing Via One full-prefix Traversal) é uma substituição plug-and-play sem treinamento para o indexador DeepSeek Sparse Attention (DSA) que reduz a redundância computacional ao compartilhar uma única varredura de prefixo entre um grupo de consultas próximas. Em vez de pontuar cada token precedente para cada consulta individualmente, o PIVOT agrega o grupo em uma única consulta proxy para obter um conjunto de candidatos, do qual os top-k tokens são selecionados para cada consulta.

arxiv arXiv cs.CL · há 18 d · 2 visualizações

Framework Zing melhora a inteligência social de LLMs por meio do benchmark SoMBench e fundamentação Actio

O relatório apresenta o Zing, um framework integrado projetado para aprimorar a inteligência social de grandes modelos de linguagem ao medir, internalizar e fundamentar capacidades sociais. Os autores apresentam o SoMBench, um benchmark fundamentado na psicologia que abrange 17 dimensões secundárias e 3.481 instâncias verificadas por especialistas, revelando que os LLMs atuais têm uma margem significativa de melhoria, sem nenhum modelo alcançar desempenho próximo ao teto.