Un usuario reportó que eliminar la variable de entorno GGML_CUDA_ALLREDUCE llevó a una mejora notable en el throughput (TPS) para MTP en inferencia de LLM local. El cambio, que previamente se consideraba beneficioso, redujo inesperadamente la sobrecarga y mejoró el rendimiento, especialmente después de extensos ensayos de configuración.
Finalmente viendo beneficios de MTP después de eliminar GGML_CUDA_ALLREDUCE
El SDK de Python de OpenAI v0.21.0 añade APIs de pruebas independientes del proveedor y compatibilidad con OpenAI v3
OpenAI lanzó la versión 0.21.0 del SDK openai-agents-python, introduciendo nuevas utilidades de pruebas independientes del proveedor y actualizando la compatibilidad para la versión 3 de la biblioteca Python de OpenAI.
llama.cpp b10435 corrige el costo cuadrático en jinja gather_string_parts
El proyecto llama.cpp ha lanzado la versión b10435, que aborda un problema de rendimiento dentro del motor de plantillas Jinja. El cambio principal corrige un error de complejidad de tiempo cuadrático en la función `gather_string_parts`.
Claude Code v2.1.233 añade soporte para MR de GitLab, límites de memoria y desactiva herramientas de tareas pendientes en nuevos modelos
Anthropic lanzó Claude Code v2.1.233, introduciendo varias nuevas características y correcciones que incluyen soporte para URL de solicitudes de fusión de GitLab para la bandera `--worktree` y la vista `claude agents`. La actualización también añade soporte opcional para cgroups de memoria para comandos de herramientas Bash en Linux para evitar que las compilaciones descontroladas bloqueen las sesiones.
xAI lanza el modelo de codificación Grok 4.6 en GitHub Copilot
xAI ha puesto su último modelo de codificación, Grok 4.6, disponible dentro de GitHub Copilot para desarrolladores que usan VS Code y otras plataformas. Los usuarios pueden seleccionar el nuevo modelo a través del selector de modelos, mientras que los clientes empresariales pueden necesitar habilitarlo a través de la configuración de Copilot.
Z.ai lanza GLM-5.3 con postentrenamiento extendido
Z.ai anunció GLM-5.3, un nuevo modelo que alcanza un rendimiento de vanguardia en benchmarks de programación agéntica al extender el postentrenamiento de su modelo base GLM-5.2. El modelo de ~750B parámetros supera actualmente a Kimi K3 e iguala o supera a Claude Fable 5 y GPT-5.6-Sol en varios benchmarks.