Inference efficiency
github llama.cpp · hace 7 h · 2 vistas

llama.cpp v0.5.0 añade soporte para HRM-Text, aceleración de conv2d en CUDA y enlace a múltiples direcciones

El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.

lab Microsoft Research Blog · hace 9 h · 14 vistas

Microsoft Research muestra que la descarga de inferencia de IA física mejora el rendimiento y la vida útil de la batería de los robots

Microsoft Research desafía la suposición de que la inferencia de IA física debe ejecutarse exclusivamente en las GPUs a bordo del robot, demostrando que descargarla a infraestructura perimetral o en la nube mejora significativamente las cargas de trabajo de manipulación móvil. Su estudio sistemático de cargas de trabajo de robótica revela que depender del cálculo a bordo limita el rendimiento, la vida útil de la batería y la escalabilidad.

arxiv arXiv cs.AI · hace 1 d · 15 vistas

CliffCompaction reduce los costos de los agentes de codificación en un 50 % mientras mantiene el rendimiento

Los investigadores presentan CliffCompaction, una técnica de autocompacción diseñada para reducir los costos de los agentes de codificación de largo alcance hasta en un 50 % bajo un contexto acotado. El método mantiene o mejora el rendimiento en Terminal-Bench y logra resultados de última generación en KernelBench al mantener la información compactada fiel mediante truncamiento en lugar de reformulación.

arxiv arXiv cs.LG · hace 1 d · 13 vistas

CliffCompaction reduce los costos de agentes de codificación de largo alcance hasta en un 50% mientras mantiene el rendimiento

Los investigadores presentan CliffCompaction, una técnica de autocompacción diseñada para agentes que manejan millones de tokens, la cual reduce los costos hasta en un 50% bajo contexto acotado. El método mantiene o mejora el rendimiento en Terminal-Bench y logra resultados de vanguardia en KernelBench al mantener la información fiel mediante truncamiento en lugar de reformulación.

lab OpenAI News · hace 1 d · 19 vistas

Reducción a la mitad del tiempo y costo de investigación con GPT-6 Astra

Parallel ha integrado GPT-6 Astra de OpenAI en su infraestructura de agentes de IA, logrando una reducción del 50% tanto en el tiempo de investigación como en los costos de código en comparación con modelos anteriores. La empresa informa que el nuevo modelo permite a los agentes completar trabajos de conocimiento complejos significativamente más rápido mientras mantiene un alto nivel de calidad.

github llama.cpp · hace 2 d · 12 vistas

llama.cpp añade soporte para DFlash en HunyuanOCR y corrige la conversión de borrador

El proyecto llama.cpp ha añadido soporte para la decodificación especulativa DFlash con el modelo HunyuanOCR, exponiendo los tensores de entrada de las capas en el grafo objetivo. Este cambio permite que el modelo de borrador lea los flujos residuales, lo que posibilita que las solicitudes de imagen se ejecuten correctamente con una tasa de aceptación del borrador de aproximadamente 0.5 y una salida OCR idéntica a nivel de bytes en comparación con las ejecuciones no especulativas.