Un análisis de carga de trabajo real muestra que headroom, rtk y caveman reducen los costos de tokens en 2.8%, 0.5% y 0.4% respectivamente, sumando un 3.7% del gasto base. Sin embargo, los ahorros están limitados por la diversidad de payloads, con la mayor parte del tráfico siendo texto plano o código fuente, y las herramientas solo comprimen salidas estructuradas. La mayor reducción de costos ocurre en el flujo de tokens más barato—lecturas de caché—mientras que las herramientas no afectan el almacenamiento en caché de prompts ni los costos de salida, y existen brechas de cobertura, especialmente para rtk.
Ahorros reales en costos de tokens con rtk, headroom y caveman
llama.cpp b11000 corrige la ejecución remota de código mediante uso tras liberar el gráfico de cómputo en caché
El proyecto llama.cpp lanzó la versión b11000, que aborda una vulnerabilidad crítica de seguridad en el servidor RPC. La corrección resuelve un error de uso tras liberar que permitía a clientes remotos no autenticados lograr la ejecución remota de código manipulando los gráficos de cómputo en caché.
OpenAI escala el servicio de almacenamiento Habitat a 70 millones de solicitudes por segundo
OpenAI ha escalado su plataforma interna de almacenamiento en línea, Habitat, para manejar más de 70 millones de solicitudes por segundo para más de mil millones de usuarios semanales de ChatGPT en casi 40 regiones geográficas. El sistema ahora sirve más de 500 petabytes de datos, evolucionando desde una sencilla biblioteca del lado del cliente en Python hasta un servicio distribuido complejo.
CyberTiel 35B-A3B sin censura en cuantización de 4 bits supera a Opus 4.6 medium en problemas de bases de código
Un investigador anónimo ha lanzado CyberTiel 35B-A3B, un modelo cuantizado de 4 bits sin censura diseñado para investigación en seguridad ofensiva e ingeniería de software agéntica. El modelo se construye mediante abliteration sobre la base TielCoder y cuantización con una imatrix mejorada derivada de un corpus curado de ciberseguridad.
qwen4exp añade soporte de reversión de estado recurrente para descodificación especulativa MTP
El proyecto qwen4exp ha implementado soporte de reversión de estado recurrente para habilitar la descodificación especulativa con predicción multi-tokens (MTP) efectiva. Este cambio permite que el estado objetivo retroceda en el número de tokens borrador rechazados, evitando la serialización innecesaria de todo el estado recurrente a la memoria del host.
Investigador de inyección de prompts rompe el Modo Automático de Claude Code Opus 5
Anthropic recientemente estableció el modo automático de Claude Code como predeterminado para proteger a los usuarios contra ataques de inyección de prompts, pero el investigador Johann Rehberger ha demostrado una vulnerabilidad significativa en este mecanismo de seguridad. Identificó un ataque que tiene éxito aproximadamente el 80% de las veces al engañar al agente para que descargue y descomprima un archivo zip que contiene un archivo Python malicioso.