Пользователь сообщил, что удаление переменной окружения GGML_CUDA_ALLREDUCE привело к заметному улучшению пропускной способности (TPS) для MTP в локальной инференсе больших языковых моделей. Изменение, ранее считавшееся полезным, неожиданно снизило перегрузку и улучшило производительность, особенно после длительных испытаний конфигурации.
Наконец-то видим выгоды MTP после удаления GGML_CUDA_ALLREDUCE
OpenAI Python SDK v0.21.0 добавляет провайдер-независимые API тестирования и совместимость с OpenAI v3
OpenAI выпустила версию 0.21.0 пакета openai-agents-python, представив новые утилиты тестирования, независимые от провайдера, и обновив совместимость для версии 3 библиотеки OpenAI Python.
llama.cpp b10435 исправляет квадратичную стоимость в jinja gather_string_parts
Проект llama.cpp выпустил версию b10435, которая устраняет проблему производительности в шаблонизаторе Jinja. Основное изменение исправляет ошибку с квадратичной временной сложностью в функции `gather_string_parts`.
Claude Code v2.1.233 добавляет поддержку MR в GitLab, ограничения памяти и отключает инструменты todo для новых моделей
Anthropic выпустила Claude Code v2.1.233, представив несколько новых функций и исправлений, включая поддержку URL слияния запросов (merge request) GitLab для флага `--worktree` и представления `claude agents`. Обновление также добавляет возможность включения поддержки cgroup памяти для команд инструментов Bash в Linux, чтобы предотвратить зависание сессий из-за бесконтрольных процессов сборки.
xAI выпустила модель для кодинга Grok 4.6 в GitHub Copilot
xAI сделала свою последнюю модель для кодинга Grok 4.6 доступной в GitHub Copilot для разработчиков, использующих VS Code и другие платформы. Пользователи могут выбрать новую модель через выбор модели, тогда как корпоративным клиентам может потребоваться включить её через настройки Copilot.
Z.ai выпускает GLM-5.3 с расширенным постобучением
Z.ai анонсировала GLM-5.3, новую модель, которая демонстрирует передовые результаты на бенчмарках агентного программирования благодаря расширению этапа постобучения своей базовой модели GLM-5.2. Модель с ~750B параметров в настоящее время превосходит Kimi K3 и сопоставима или превосходит Claude Fable 5 и GPT-5.6-Sol на различных бенчмарках.