Tmax-27B — это терминальный агент, основанный на Qwen3.6-27B, обученный с использованием DPPO (RL), достигающий 43% на Terminal Bench 2.0 и 69% на TB Lite. Для работы на потребительских видеокартах он квантируется с использованием калиброванных матриц важности GGUF моделей с 2 до 5 бит на вес, с встроенной головой MTP, обеспечивающей спекулятивное декодирование. Модель IQ2_XS размером 8,5 ГиБ достигает 70% в задачах агентного программирования, превосходя простую квантизацию и демонстрируя стабильность генерации инструментальных вызовов.
Агент Tmax-27B для малых видеокарт с обучением DPPO
Бенчмарки
| Бенчмарк | Модель | Результат |
|---|---|---|
| Terminal-Bench 2 | Tmax-27B | 43% |
Claude Code v2.1.267 добавляет maxEffortLevel и исправляет стабильность prompt-cache
Версия Claude Code 2.1.267 вводит новый параметр `maxEffortLevel` для ограничения усилий на всех провайдерах, а также значительные исправления стабильности prompt-cache и возобновления сессий. Обновление также устраняет различные ошибки во взаимодействии с VS Code, Claude Tag и облачном планировании.
Mistral помогает европейскому энергетическому оператору перевести 40 000 строк Fortran 77 на C++
Mistral помогла европейскому энергетическому оператору перенести 40 000 строк устаревшего кода Fortran 77 для симулятора резервуара, требовательного к физическим расчетам, на современный C++. Проект решал проблемы перевода процедурного кода с глобальным состоянием в объектно-ориентированную архитектуру при обеспечении численного соответствия.
OpenAI Agents Python v0.22.2 добавляет поддержку генерации изображений и исправляет гонки ссылок
OpenAI выпустила версию 0.22.2 SDK openai-agents-python, внедрив новые возможности для генерации изображений и устранив проблемы стабильности при обработке песочницы и сессий.
ZYR представляет ZYR3.1 с управлением ATP, сетью агентов ACN и контекстом на 1M токенов
ZYR представила ZYR3.1 — систему ИИ, предназначенную для выполнения сложных задач, а не просто для ответа на запросы. Архитектура основана на ATP как основном центре управления и ACN как сети агентного взаимодействия.
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.