Hardware & chips
lab NVIDIA Research · há 7 d · 16 visualizações

ShareMMU permite o compartilhamento seguro de tradução de endereços entre aceleradores não confiáveis com baixa sobrecarga

Pesquisadores apresentam o ShareMMU, um design de IOMMU que permite que múltiplos aceleradores não confiáveis reutilizem com segurança endereços previamente traduzidos dentro de um espaço de endereço virtual compartilhado. Esta abordagem mitiga riscos de canais laterais associados a grandes Buffers de Tradução Compartilhada (TLBs) enquanto mantém alto desempenho.

media Hugging Face Forums · há 11 d · 13 visualizações

Proposta para tempo de execução de IA neutro em relação a fornecedores com execução consciente do orçamento de memória

Uma proposta nos fóruns da Hugging Face descreve uma camada comum de execução de GPU e gerenciamento de memória projetada para desacoplar o código de aplicação de fornecedores específicos de hardware, como NVIDIA, AMD e Intel. O objetivo é permitir que os usuários especifiquem um orçamento de memória em vez de configurar manualmente sinalizações específicas do backend, mapeamentos de dispositivo ou estratégias de offloading.

lab NVIDIA Research · há 11 d · 21 visualizações

NVIDIA lança GPIR para recuperação privada de informação acelerada por GPU

Pesquisadores da NVIDIA apresentaram o GPIR, um sistema que acelera a Recuperação Privada de Informação (PIR) em GPUs ao abordar a alta computação e o tráfego de memória no lado do servidor inerentes aos protocolos baseados em reticulados. O sistema emprega um modelo de execução híbrido consciente das etapas que alterna dinamicamente entre kernels em nível de operação e em nível de etapa para maximizar a reutilização de dados no chip.

lab NVIDIA Research · há 11 d · 21 visualizações

NVIDIA caracteriza desempenho e custo de MPC e FHE para PPML

Um novo estudo apresenta uma caracterização unificada em nível de sistema da computação multipartidária segura (MPC) e criptografia totalmente homomórfica (FHE) para inferência de aprendizado de máquina que preserva a privacidade. O trabalho avalia duas variantes de MPC — conversão de compartilhamento aritmético/binário e compartilhamento secreto de funções — junto com FHE em múltiplos modelos CNN e Transformer.

lab OpenAI News · há 15 d · 39 visualizações

Sol GPT-5.6 do MIT automatiza calibração de chips quânticos via Codex

Beatriz Yankelevich, do Grupo de Engenharia de Sistemas Quânticos do MIT, utilizou o GPT‑5.6 Sol, integrado ao Codex, para executar e refinar autonomamente medições rotineiras em qubits supercondutores. Essa integração permite que o agente de IA opere softwares de laboratório, analise resultados e decida sobre as etapas subsequentes sem supervisão humana constante.

github llama.cpp · há 16 d · 44 visualizações

llama.cpp b10839 corrige falhas de alinhamento em GET_ROWS do Vulkan

O projeto llama.cpp lançou a versão b10839, que resolve falhas graves no backend Vulkan causadas por deslocamentos desalinhados durante operações de recuperação de linhas de tensores. Anteriormente, modelos como Qwen3-TTS e Qwen3-VL falhavam ao usar `ggml_view` com deslocamentos de visualização não nulos porque o shader gerava asserções em violações de alinhamento em relação a `minStorageBufferOffsetAlignment`. Esta atualização implementa suporte nativo para deslocamentos alinhados nos caminhos quantizados e não quantizados, eliminando a necessidade de fallbacks na CPU.