Un análisis de costos estima que alojar diffusiongemma a diferentes niveles de tokens por usuario genera costos mensuales por usuario que oscilan entre 1,7€ y 122,8€. El estudio encuentra que el uso de IA agéntica es económicamente insostenible para el alojamiento colectivo, aunque los costos podrían disminuir con nuevas GPUs o ASICs y un período de depreciación de la GPU más corto.
Cálculos rápidos sobre los costos de alojamiento colectivo para diffusiongemma en 2026
Estudio empírico de la cuantización OpenPangu en NPUs Ascend
Un estudio controlado evalúa los modelos OpenPangu 1B y 7B en NPUs Huawei Ascend 910B1 utilizando métodos de cuantización solo de pesos y de pesos-activación. Los resultados muestran que la cuantización solo de pesos de 8 bits es sin pérdidas para ambos modelos, mientras que la cuantización de 4 bits es práctica para el modelo 7B pero perjudicial para el 1B en tareas de razonamiento, matemáticas y código. Los métodos de ultra baja precisión como 2 bits y binarios fallan, y W4A4 SmoothQuant produce una perplejidad no finita, lo que indica que la compresión extrema de pocos bits sigue siendo un desafío.
webAI lanza TwIL-LM, una familia de modelos de lógica formal de 1.7B y 3B para autoformalización local
webAI ha lanzado TwIL-LM, una familia de dos razonadores de lógica formal con 1.7B y 3B de parámetros diseñados para autoformalización en hardware local. Los modelos traducen inglés a lógica de primer orden y verifican la validez de las conclusiones, con la variante de 3B logrando un puntaje macro gate de 0.4218 en tareas de lógica formal dentro del dominio.
QuantCheck advierte contra asumir que el checkpoint final es el mejor para cuantización de 4 bits
Una nueva herramienta llamada QuantCheck destaca que el checkpoint final del preentrenamiento puede no ser la opción óptima para la cuantización de 4 bits, ya que los benchmarks pueden permanecer planos mientras aumenta la fragilidad. El autor observó este patrón en Pythia-160m, donde el checkpoint final sufrió aproximadamente cuatro veces más daño a la calidad que un checkpoint anterior de igual calidad.
Meituan lanza LongCat-Flash-Lite-Sparse con ventana de contexto de 1M
Meituan ha publicado los pesos para LongCat-Flash-Lite-Sparse, una nueva variante de su modelo LongCat-Flash-Lite. La actualización introduce LongCat Sparse Attention (LSA) para reemplazar el MLA denso y extiende el soporte nativo de longitud de contexto a 1 millón de tokens.
OSReward introduce una evaluación estandarizada para modelos de recompensa de uso de computadora multiplataforma
Los investigadores presentan OSReward, un benchmark realista diseñado para evaluar la fiabilidad de los modelos de visión y lenguaje (VLM) que actúan como jueces para trayectorias de agentes que utilizan computadoras. El estudio revela que incluso los VLM más avanzados adolecen de un sesgo sistemático de indulgencia y suelen ser demasiado costosos para su escalado, mientras que los modelos abiertos asequibles tienen un rendimiento deficiente.