Claude Code v2.1.181 вводит поддержку настройки параметров конфигурации через синтаксис промпта, например /config thinking=false, добавляет поддержку событий Apple в среде macOS и улучшает поведение потокового вывода, автоматического повтора и подагентов. Также исправлены множество ошибок, связанных с запуском, обработкой файлов, копированием и отзывчивостью интерфейса на разных платформах.
Официальные заметки по выпуску Claude Code v2.1.181
Исследование счетов за Claude Code показывает, что сокращение контекста не снижает затраты
Исследование 2848 запусков Claude Code, оплачиваемых провайдерами, выявило, что уменьшение объема извлекаемого контекста или вывода инструментов не гарантирует снижения фактической оплачиваемой стоимости работы кодовых агентов. Исследование ставит под сомнение распространенный метрический подход удаления текста путем анализа кампании из 2908 выполнений на трех моделях и семи репозиториях.
Дополнение: DeepSeek V4 Flash на 2x RTX PRO 6000 завершает реальные задачи кодирования быстрее Sonnet и Opus, при качестве примерно на уровне Sonnet
Дополнительное бенчмарк-тестирование оценивает работу DeepSeek V4 Flash на двух GPU RTX PRO 6000 с использованием vLLM, сравнивая её производительность в реальных задачах кодирования с API-моделями, такими как Claude Sonnet и Opus. Исследование показывает, что хотя Opus и Fable сохраняют превосходное качество кода, DeepSeek V4 Flash достигает качества примерно на уровне Sonnet при значительно меньшем времени выполнения.
TestEvo-Bench: Исполняемый и живой бенчмарк для совместной эволюции тестов и кода
Авторы представляют TestEvo-Bench, живой бенчмарк, предназначенный для оценки того, насколько хорошо агенты автоматизации тестирования справляются с совместной эволюцией кода и тестов. Он устраняет ограничения существующих бенчмарков, предоставляя исполняемые задачи, привязанные к реальным историям коммитов с конфигурациями окружения.
Обнаружение ИИ-агентов для программирования в открытых исходных кодах: проверенная многометодная перепись 180 миллионов репозиториев
Многоуровневая система обнаружения, анализирующая 180 миллионов Git-репозиториев, показывает, что методы с одним сигналом значительно недооценивают распространенность генеративных ИИ-агентов для программирования, упуская до 97% активности. Исследование выявляет более 320 000 коммитов в месяц от агентов, таких как Claude Code, который доминирует в скрытом внедрении через конфигурационные файлы, а не через бот-аккаунты.
Qwen3.6 27B локально против Opus 4.8: движок вокселей на чистом C без фреймворков
Эксперимент по сравнению поставил Claude Code на базе Opus 4.8 против локально запущенной модели Qwen3.6 27B для создания движка воксельного мира на чистом C без внешних фреймворков или библиотек.