Tema · Inference efficiency
lab OpenAI News · hace 29 d · 56 vistas

OpenAI informa de que el chip Jalapeño ofrece hasta 3,6 veces menor latencia y 1,9 veces mayor eficiencia

OpenAI ha publicado los resultados iniciales de rendimiento de Jalapeño, su primer chip de inferencia personalizado, demostrando ganancias significativas en velocidad y eficiencia energética en comparación con los sistemas comerciales existentes. La empresa afirma que la nueva arquitectura permite un mayor rendimiento y menor latencia simultáneamente, abordando una compensación común en el hardware actual.

lab Microsoft Research Blog · hace 6 h · 14 vistas

Microsoft Research muestra que la descarga de inferencia de IA física mejora el rendimiento y la vida útil de la batería de los robots

Microsoft Research desafía la suposición de que la inferencia de IA física debe ejecutarse exclusivamente en las GPUs a bordo del robot, demostrando que descargarla a infraestructura perimetral o en la nube mejora significativamente las cargas de trabajo de manipulación móvil. Su estudio sistemático de cargas de trabajo de robótica revela que depender del cálculo a bordo limita el rendimiento, la vida útil de la batería y la escalabilidad.

lab OpenAI News · hace 1 d · 18 vistas

Reducción a la mitad del tiempo y costo de investigación con GPT-6 Astra

Parallel ha integrado GPT-6 Astra de OpenAI en su infraestructura de agentes de IA, logrando una reducción del 50% tanto en el tiempo de investigación como en los costos de código en comparación con modelos anteriores. La empresa informa que el nuevo modelo permite a los agentes completar trabajos de conocimiento complejos significativamente más rápido mientras mantiene un alto nivel de calidad.

lab NVIDIA Research · hace 9 d · 18 vistas

FastGen-PDD introduce distilación de decodificación paralela para generación rápida de video e imagen

Los investigadores presentan la Distilación de Decodificación Paralela (PDD), un método simplificado basado en trayectorias para acelerar la inferencia en modelos de difusión y emparejamiento de flujos. A diferencia de los enfoques actuales que dependen de la distilación variacional de puntuaciones difícil de optimizar y pérdidas adversarias, PDD predice múltiples pasos de desvanecimiento por evaluación de red.

lab NVIDIA Research · hace 12 d · 24 vistas

NVIDIA lanza GPIR para la recuperación privada de información acelerada por GPU

Investigadores de NVIDIA han presentado GPIR, un sistema que acelera la Recuperación Privada de Información (PIR) en GPUs abordando la alta computación y el tráfico de memoria en el lado del servidor inherentes a los protocolos basados en retículas. El sistema emplea un modelo de ejecución híbrido consciente de las etapas que cambia dinámicamente entre kernels a nivel de operación y a nivel de etapa para maximizar la reutilización de datos en el chip.

lab NVIDIA Research · hace 12 d · 24 vistas

NVIDIA caracteriza el rendimiento y costo de MPC y FHE para PPML

Un nuevo estudio presenta una caracterización unificada a nivel de sistema de la computación multipartita segura (MPC) y la criptografía totalmente homomórfica (FHE) para inferencia de aprendizaje automático que preserva la privacidad. El trabajo evalúa dos variantes de MPC —conversión de compartición aritmética/binaria y compartición secreta de funciones— junto con FHE en múltiples modelos CNN y Transformer.

lab OpenAI News · hace 12 d · 35 vistas

OpenAI escala el servicio de almacenamiento Habitat a 70 millones de solicitudes por segundo

OpenAI ha escalado su plataforma interna de almacenamiento en línea, Habitat, para manejar más de 70 millones de solicitudes por segundo para más de mil millones de usuarios semanales de ChatGPT en casi 40 regiones geográficas. El sistema ahora sirve más de 500 petabytes de datos, evolucionando desde una sencilla biblioteca del lado del cliente en Python hasta un servicio distribuido complejo.

lab NVIDIA Research · hace 26 d · 31 vistas

Twill deriva automáticamente horarios óptimos de software pipelining y especialización de warp para GPUs con Tensor Cores

Los investigadores han presentado Twill, un sistema que formula el software pipelining (SWP) y la especialización de warp (WS) como un problema de optimización conjunta resoluble por solucionadores de restricciones comerciales. Este enfoque automatiza la derivación de horarios óptimos de ejecución para programas iterativos en arquitecturas GPU.

media MarkTechPost · hace 14 d · 52 vistas

DeepSeek lanza DeepSeek-V4.1-Flash con contexto de 1M y caché KV FP4

DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal Mixture-of-Experts que cuenta con una ventana de contexto de 1 millón de tokens y una caché KV FP4 que reduce la huella global de la caché a 890 bytes por token. El modelo utiliza una arquitectura de codificador-decodificador causal y Compressed Sparse Attention 2 (CSA2) para reducir significativamente los requisitos de memoria mientras mantiene el rendimiento.

lab Hugging Face Blog · hace 30 d GPQA Diamond · 67.4% · 41 vistas

La QAH de Multiverse Computing hace que GPT-OSS de 4 bits supere a su versión original de precisión completa

Multiverse Computing presenta la Curación Consciente de Cuantización (QAH), un método que destila grandes modelos de lenguaje comprimidos y cuantizados directamente a partir de sus maestros originales previos a la compresión. Aplicado a un modelo GPT-OSS 120B comprimido a 60B parámetros y cuantizado a MXFP4, el enfoque produce un modelo que supera su propia versión bfloat16 de precisión completa en 7 de los 9 benchmarks.

github llama.cpp · hace 4 h · 2 vistas

llama.cpp v0.5.0 añade soporte para HRM-Text, aceleración de conv2d en CUDA y enlace a múltiples direcciones

El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.