AI agents
media TLDR AI · 2 ч назад · 10 просмотров

Anthropic выпустила Claude Projects v2; Google представила семейного агента

Anthropic выпустила Claude Projects v2, переработав функцию из структуры на основе папок в интерфейс, управляемый диалогом, который управляет сборками через делегирование задач и параллельные потоки. Одновременно Google тестирует семейного агента, работающего на выделенном облачном компьютере для координации действий до шести членов семьи.

media TLDR AI · 2 ч назад AIME 2024 · 50.0% · 9 просмотров

Meta открывает коннекторы Muse, выпускает SAM 3.1 и Gemini взламывает системы

Это обновление охватывает несколько событий в сфере ИИ, включая открытие Meta своей платформы Muse для сторонних разработчиков, выпуск новой версии модели сегментации и инцидент с безопасностью, связанный с Google Gemini.

media TLDR AI · 2 ч назад · 10 просмотров

Xiaomi открыла исходный код моделей MiMo-V2.6 Pro и Flash

Xiaomi открыла исходный код омнимодальных моделей MiMo-V2.6 Pro и Flash, предназначенных для координации агентов при создании и визуальном тестировании интерактивных 3D-сцен. Эти модели могут генерировать ассеты Blender, управлять роботизированными манипуляторами по данным с камер, создавать фронтенды и презентации, собирать видео и сочинять музыку в виде партитур и MIDI.

arxiv arXiv cs.AI · 2 ч назад · 9 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для агента ИИ в области научных исследований за счёт оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах научно-исследовательской деятельности в сфере ИИ и сохраняет только те улучшения, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.AI · 3 ч назад WebArena · 45.3% · 12 просмотров

Growing Harness превращает повторяющееся управление агентами в переиспользуемый код с помощью обучения, направляемого ошибками

Авторы представляют Growing Harness — парадигму обучения, которая изучает структуру управления агентом на основе обратной связи от задач, а не полагается на стандартные тяжеловесные контекстные обвязки. Преобразуя повторяющиеся решения по управлению в исполняемый код и оставляя вызовы LLM для семантического рассуждения, метод стремится создавать переиспользуемых специализированных агентов.

arxiv arXiv cs.AI · 3 ч назад · 9 просмотров

CliffCompaction снижает затраты на кодирование агентов на 50% при сохранении производительности

Исследователи представляют CliffCompaction, технику автокомпактизации, предназначенную для снижения затрат на долгосрочных кодовых агентах до 50% в рамках ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности сжатой информации через усечение, а не перефразирование.

arxiv arXiv cs.LG · 4 ч назад · 11 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для передового агента ИИ, занимающегося научными исследованиями, путём оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах ИИ-исследований и разработок (R&D) и сохраняет только те обновления, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.LG · 5 ч назад · 9 просмотров

CliffCompaction снижает затраты на долгосрочных задачах программирования для агентов до 50%, сохраняя производительность

Исследователи представляют CliffCompaction, метод автокомпактизации, разработанный для агентов, обрабатывающих миллионы токенов, который сокращает затраты до 50% в условиях ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности информации при усечении, а не перефразировании.

arxiv arXiv cs.CL · 6 ч назад · 12 просмотров

Agensh масштабирует организационный интеллект до 1024 агентов

Исследователи представляют Agensh, масштабируемую самоорганизующуюся многоагентную среду, которая устраняет узкое место центрального оркестратора, позволяя параллельным рабочим асинхронно брать подзадачи и объединять прогресс.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

Qwen выпустила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель с контекстом в 1 млн токенов

Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.

lab xAI News · 10 ч назад · 15 просмотров

SpaceXAI использует Grok Bot для обработки роста тикетов на 175% без найма

После приобретения Cursor SpaceXAI интегрировала своего ИИ-агента Grok Bot в объединённую службу поддержки, что позволило команде справиться с ростом количества тикетов на 175% без увеличения штата. Компания избежала найма примерно 200 дополнительных сотрудников и снизила стоимость решения каждого тикета до диапазона от $0.20 до $0.30 благодаря использованию модели ценообразования Grok Bot, зависящей от объёма потребления.

lab OpenAI News · 10 ч назад · 16 просмотров

Сокращение времени и стоимости исследований вдвое с помощью GPT-6 Astra

Parallel интегрировала GPT-6 Astra от OpenAI в свою инфраструктуру AI-агентов, что позволило сократить время исследований и затраты на код на 50% по сравнению с предыдущими моделями. Компания сообщает, что новая модель позволяет агентам выполнять сложную интеллектуальную работу значительно быстрее, сохраняя при этом высокое качество результатов.

lab OpenAI News · 12 ч назад · 21 просмотр

OpenAI улучшает кэширование промптов GPT-6 с более высокой частотой попаданий и диагностикой

OpenAI запустила улучшенную систему кэширования промптов для семейства GPT-6, которая по умолчанию обеспечивает более высокую частоту попаданий в кэш и предоставляет скидки до 90% на токены входных данных из кэша. Обновление включает новые инструменты для помощи разработчикам в мониторинге производительности, диагностике промахов и оптимизации их интеграций.

lab Claude Code Releases · 16 ч назад · 14 просмотров

Claude Code v2.1.280 добавляет Claude Opus 5.5 и исправляет множество ошибок

Версия Claude Code 2.1.280 представляет Claude Opus 5.5 в качестве новой модели Opus по умолчанию, с контекстным окном на 1M и обновлённым ценообразованием. Обновление также добавляет поддержку колёсика мыши для прокрутки списков в полноэкранном режиме и позволяет настраивать ограничения длины описания инструментов MCP.

arxiv arXiv cs.AI · 21 ч назад · 11 просмотров

Генератор состояния мира согласует планы с синтетическими мирами для повышения успеха агентов

Генератор состояния мира (WSG) — это модель, которая удерживает планы языковых агентов в соответствии с правилами их среды выполнения, переписывая состояния после неудач. Она обучена на 226K траекториях, извлечённых из семи синтетических доменов, где программа обеспечивает соблюдение правил и проверяет достижимость цели.

media Latent Space · 22 ч назад · 11 просмотров

Xiaomi выпустила MiMo-V2.6-Pro, ведущую открытую омнимодельную модель, обученную за $3 млн

Xiaomi выпустила серию MiMo-V2.6, представив нативно омнимодельные модели, включая MiMo-V2.6-Pro и MiMo-V2.6-Flash. Компания также запустила MiMo-V2.6-Pro-UltraSpeed, обеспечивающую скорость вывода до 20 раз выше при том же качестве.

media Hugging Face Forums · 1 д назад · 10 просмотров

Распределённое ограничение в многоагентном ИИ управляет агентами без коллективной идентичности

Новый анализ выделяет явление в многоагентных системах, при котором отношения, возникающие между отдельно управляемыми агентами, приобретают регулирующую силу по всей группе. Это происходит, когда агенты оставляют устойчивые сообщения и артефакты, ограничивающие траектории друг друга, формируя эффективную распределённую ориентацию, не заданную индивидуальными задачами.

media Hugging Face Forums · 1 д назад · 10 просмотров

jbsalles экспериментирует с SelMem, системой селективной памяти для LLM

Автор разработал проект на Rust под названием SelMem для экспериментов с несовершенной, зависящей от пути памятью для больших языковых моделей. Этот подход имитирует человеческую память, позволяя агентам сжимать, забывать и восстанавливать воспоминания с течением времени, а не хранить идеальные копии взаимодействий.

arxiv arXiv cs.AI · 1 д назад · 9 просмотров

AgentRouter снижает стоимость агентных рабочих процессов на 72% за счёт маршрутизации моделей на уровне шагов

Исследователи предлагают AgentRouter, лёгкий классификатор, который оптимизирует многошаговые агентные рабочие процессы, направляя отдельные шаги траектории в соответствующие уровни моделей вместо использования передовых моделей для каждой задачи. Система решает проблему неэффективности существующих решений, которые игнорируют различную сложность подзадач внутри одной сессии агента.