Tema · Inference efficiency
lab Microsoft Research Blog · há 7 d · 28 visualizações

Microsoft Research mostra que o descarregamento da inferência de IA física melhora o desempenho do robô e a vida útil da bateria

A Microsoft Research desafia a suposição de que a inferência de IA física deve ser executada exclusivamente nas GPUs onboard dos robôs, demonstrando que o descarregamento para infraestrutura de borda ou nuvem melhora significativamente as cargas de trabalho de manipulação móvel. Seu estudo sistemático das cargas de trabalho de robótica revela que depender do processamento onboard limita o desempenho, a vida útil da bateria e a escalabilidade.

lab NVIDIA Research · há 16 d · 20 visualizações

FastGen-PDD introduz destilação de decodificação paralela para geração rápida de vídeo e imagem

Pesquisadores introduzem a Destilação de Decodificação Paralela (PDD), um método simplificado baseado em trajetória para acelerar a inferência em modelos de difusão e correspondência de fluxo. Ao contrário das abordagens atuais que dependem de destilação variacional de pontuação difícil de otimizar e perdas adversariais, o PDD prevê múltiplos passos de desruído por avaliação da rede.

lab NVIDIA Research · há 19 d · 28 visualizações

NVIDIA lança GPIR para recuperação privada de informação acelerada por GPU

Pesquisadores da NVIDIA apresentaram o GPIR, um sistema que acelera a Recuperação Privada de Informação (PIR) em GPUs ao abordar a alta computação e o tráfego de memória no lado do servidor inerentes aos protocolos baseados em reticulados. O sistema emprega um modelo de execução híbrido consciente das etapas que alterna dinamicamente entre kernels em nível de operação e em nível de etapa para maximizar a reutilização de dados no chip.

lab NVIDIA Research · há 19 d · 26 visualizações

NVIDIA caracteriza desempenho e custo de MPC e FHE para PPML

Um novo estudo apresenta uma caracterização unificada em nível de sistema da computação multipartidária segura (MPC) e criptografia totalmente homomórfica (FHE) para inferência de aprendizado de máquina que preserva a privacidade. O trabalho avalia duas variantes de MPC — conversão de compartilhamento aritmético/binário e compartilhamento secreto de funções — junto com FHE em múltiplos modelos CNN e Transformer.

lab OpenAI News · há 19 d · 37 visualizações

OpenAI escala o serviço de armazenamento Habitat para 70 milhões de requisições por segundo

A OpenAI escalou sua plataforma interna de armazenamento online, chamada Habitat, para lidar com mais de 70 milhões de requisições por segundo para mais de um bilhão de usuários semanais do ChatGPT em quase 40 regiões geográficas. O sistema agora atende a mais de 500 petabytes de dados, evoluindo de uma simples biblioteca cliente-side em Python para um serviço distribuído complexo.

media MarkTechPost · há 20 d · 55 visualizações

DeepSeek lança DeepSeek-V4.1-Flash com contexto de 1M e cache KV FP4

A DeepSeek AI lançou o DeepSeek-V4.1-Flash, um modelo Mixture-of-Experts multimodal que possui uma janela de contexto de 1 milhão de tokens e um cache KV FP4 que reduz a pegada global do cache para 890 bytes por token. O modelo utiliza uma arquitetura de codificador-decodificador causal e Compressed Sparse Attention 2 (CSA2) para reduzir significativamente os requisitos de memória enquanto mantém o desempenho.

arxiv arXiv cs.CL · há 16 h · 1 visualização

Modelos de Linguagem Contextual gerenciam contexto nativamente como arquivos editáveis

Pesquisadores apresentam Modelos de Linguagem Contextual (CLMs), uma nova arquitetura que trata a janela de contexto do modelo como um arquivo editável, permitindo que o modelo faça atualizações irrestritas em sua própria memória. Essa abordagem transfere o gerenciamento de contexto do controle externo para o comportamento intrínseco do modelo, possibilitando tanto o aprendizado em contexto quanto o aprendizado paramétrico de estratégias de gerenciamento de contexto.

media Hugging Face Forums · há 18 h · 1 visualização

AI Hardware Fit conecta os requisitos de VRAM do modelo à seleção de GPU

O criador do AI Hardware Fit lançou uma ferramenta gratuita e de código aberto para navegador, projetada para ajudar os usuários a determinar se um modelo local cabe na sua GPU e comparar opções de hardware adequadas. A ferramenta aborda a complexidade de juntar arquivos de modelos, quantização, comprimento de contexto e suporte de tempo de execução provenientes de fontes diversas.