Hardware & chips
github llama.cpp · hace 7 d · 20 vistas

llama.cpp b10994 corrige NaN de Metal en mul_mm_id para activaciones grandes

La versión llama.cpp b10994 incluye una corrección para el backend de Metal que resuelve las salidas NaN en la operación `mul_mm_id` cuando los valores de activación superan el rango f16. Este defecto anteriormente hacía que modelos como Mistral Small 4 produjeran vocabularios completamente NaN durante los pasos de prellenado de 32 tokens o más en dispositivos Apple Silicon.

lab NVIDIA Research · hace 7 d · 16 vistas

ShareMMU permite el intercambio seguro de traducción de direcciones entre aceleradores no confiables con baja sobrecarga

Los investigadores presentan ShareMMU, un diseño de IOMMU que permite a múltiples aceleradores no confiables reutilizar de forma segura direcciones previamente traducidas dentro de un espacio de direcciones virtuales compartido. Este enfoque mitiga los riesgos de canales laterales asociados con grandes búferes de traducción compartidos (TLB) mientras mantiene un alto rendimiento.

media Hugging Face Forums · hace 11 d · 13 vistas

Propuesta de un entorno de ejecución de IA independiente del proveedor con gestión de memoria consciente

Una propuesta en los foros de Hugging Face describe una capa común de ejecución y gestión de memoria para GPU, diseñada para desacoplar el código de la aplicación de proveedores específicos de hardware como NVIDIA, AMD e Intel. El objetivo es permitir a los usuarios especificar un presupuesto de memoria en lugar de configurar manualmente indicadores específicos del backend, mapas de dispositivos o estrategias de descarga.

lab NVIDIA Research · hace 11 d · 21 vistas

NVIDIA lanza GPIR para la recuperación privada de información acelerada por GPU

Investigadores de NVIDIA han presentado GPIR, un sistema que acelera la Recuperación Privada de Información (PIR) en GPUs abordando la alta computación y el tráfico de memoria en el lado del servidor inherentes a los protocolos basados en retículas. El sistema emplea un modelo de ejecución híbrido consciente de las etapas que cambia dinámicamente entre kernels a nivel de operación y a nivel de etapa para maximizar la reutilización de datos en el chip.

lab NVIDIA Research · hace 11 d · 21 vistas

NVIDIA caracteriza el rendimiento y costo de MPC y FHE para PPML

Un nuevo estudio presenta una caracterización unificada a nivel de sistema de la computación multipartita segura (MPC) y la criptografía totalmente homomórfica (FHE) para inferencia de aprendizaje automático que preserva la privacidad. El trabajo evalúa dos variantes de MPC —conversión de compartición aritmética/binaria y compartición secreta de funciones— junto con FHE en múltiples modelos CNN y Transformer.

lab OpenAI News · hace 15 d · 39 vistas

El Sol GPT-5.6 de MIT automatiza la calibración de chips cuánticos mediante Codex

Beatriz Yankelevich del Grupo de Sistemas Cuánticos de Ingeniería de MIT utilizó GPT‑5.6 Sol, integrado con Codex, para ejecutar y refinar automáticamente mediciones rutinarias en qubits superconductores. Esta integración permite que el agente de IA opere el software de laboratorio, analice los resultados y decida sobre los pasos siguientes sin supervisión humana constante.

github llama.cpp · hace 16 d · 44 vistas

llama.cpp b10839 corrige los fallos por desalineación de desplazamientos en GET_ROWS de Vulkan

El proyecto llama.cpp lanzó la versión b10839, que resuelve fallos graves en el backend de Vulkan causados por desplazamientos desalineados durante las operaciones de recuperación de filas de tensores. Anteriormente, modelos como Qwen3-TTS y Qwen3-VL fallaban al usar `ggml_view` con desplazamientos de vista distintos de cero porque el shader generaba una aserción ante violaciones de alineación en relación con `minStorageBufferOffsetAlignment`. Esta actualización implementa soporte nativo para desplazamientos alineados tanto en las rutas cuantizadas como no cuantizadas, eliminando la necesidad de recurrir a la CPU.