Реальный анализ нагрузки показывает, что headroom, rtk и caveman снижают затраты на токены на 2,8%, 0,5% и 0.4% соответственно, что в сумме составляет 3,7% от базовых расходов. Однако сокращения ограничены разнообразием нагрузки, поскольку большая часть трафика состоит из простого текста или исходного кода, а инструменты сжимают только структурированные выводы. Большинство сокращений происходит в наиболее дешёвом потоке токенов — при чтении кэша, при этом инструменты не влияют на кэширование промптов или затраты на выводы, и существуют пробелы в охвате, особенно в отношении rtk.
Снижение затрат на токены в реальных условиях за счёт headroom, rtk и caveman
llama.cpp b11000 устраняет удалённое выполнение кода через use-after-free в кэшированном вычислительном графе
Проект llama.cpp выпустил версию b11000, которая устраняет критическую уязвимость безопасности в RPC-сервере. Исправление решает проблему use-after-free, позволявшую неаутентифицированным удалённым клиентам выполнять удалённый код путём манипуляции с кэшированными вычислительными графами.
OpenAI масштабирует сервис хранения Habitat до 70 млн запросов в секунду
OpenAI масштабировала свою внутреннюю платформу онлайн-хранения данных Habitat для обработки более 70 миллионов запросов в секунду для более чем миллиарда еженедельных пользователей ChatGPT почти в 40 географических регионах. Система теперь обслуживает более 500 петабайт данных, эволюционировав из простой клиентской библиотеки на Python в сложный распределённый сервис.
CyberTiel 35B-A3B без цензуры в 4-битном квантовании превосходит Opus 4.6 medium в решении проблем с кодовой базой
Анонимный исследователь выпустил CyberTiel 35B-A3B, модель без цензуры в 4-битном квантованном виде, предназначенную для исследований в области кибербезопасности и агентного программирования. Модель создана с помощью аблитерации на базе TielCoder и квантования с улучшенным imatrix, полученным из курируемого корпуса по кибербезопасности.
qwen4exp добавляет поддержку отката рекуррентного состояния для спекулятивного декодирования MTP
Проект qwen4exp реализовал поддержку отката рекуррентного состояния, чтобы обеспечить эффективное спекулятивное декодирование с предсказанием нескольких токенов (MTP). Это изменение позволяет целевому состоянию возвращаться на количество отвергнутых черновых токенов, предотвращая ненужную сериализацию всего рекуррентного состояния в память хоста.
Исследователь инъекций промптов взламывает Claude Code Opus 5 в режиме Auto
Недавно Anthropic установила автоматический режим Claude Code по умолчанию для защиты пользователей от атак с помощью инъекций промптов, однако исследователь Йоханн Реббергер продемонстрировал значительную уязвимость в этом механизме безопасности. Он выявил атаку, которая успешно выполняется примерно в 80% случаев, обманывая агента так, что тот скачивает и распаковывает zip-архив, содержащий вредоносный Python-файл.