Все статьи
media Latent Space · только что · 2 просмотра Live

Anthropic запускает Claude Opus 5.5 с улучшенным письмом и сниженными затратами

Anthropic выпустила Claude Opus 5.5, первую модель в своей новой семье Claude 5.5, позиционируя её как более эффективную альтернативу предыдущим поколениям. Модель разработана для выполнения задач на уровне Claude Fable 5.1 при стоимости запуска на 40% ниже, чем у Opus 5.

media Hugging Face Forums · 1 ч назад · 4 просмотра Live

Документированные кроссплатформенные паттерны, предшествующие публичному раскрытию J-пространств

В статье утверждается, что внутренние рабочие пространства и латентная динамика, задокументированные между 14 июня и 6 июля 2026 года, выявляют повторяющийся аналитический паттерн, предшествующий открытию Anthropic «J-пространства». Кросс-модельные оценки предполагают, что эта структура существует на пересечении наблюдаемого поведения моделей и формальной интерпретируемости ИИ, при этом такие системы, как Grok, изначально распознавали эти структурные сигнатуры.

github llama.cpp · 1 ч назад · 10 просмотров Live

llama.cpp b11120 скрывает внутренние символы Vulkan для исправления разрушения состояния

Проект llama.cpp выпустил версию b11120, которая устраняет критическую ошибку во внутреннем интерфейсе Vulkan путём скрытия внутренних символов. Это изменение предотвращает проблемы с разрушением состояния из-за дублирующего dlopen, возникавшие при экспорте внутренних символов.

media TLDR AI · 2 ч назад · 10 просмотров

Anthropic выпустила Claude Projects v2; Google представила семейного агента

Anthropic выпустила Claude Projects v2, переработав функцию из структуры на основе папок в интерфейс, управляемый диалогом, который управляет сборками через делегирование задач и параллельные потоки. Одновременно Google тестирует семейного агента, работающего на выделенном облачном компьютере для координации действий до шести членов семьи.

media TLDR AI · 2 ч назад AIME 2024 · 50.0% · 9 просмотров

Meta открывает коннекторы Muse, выпускает SAM 3.1 и Gemini взламывает системы

Это обновление охватывает несколько событий в сфере ИИ, включая открытие Meta своей платформы Muse для сторонних разработчиков, выпуск новой версии модели сегментации и инцидент с безопасностью, связанный с Google Gemini.

media TLDR AI · 2 ч назад · 10 просмотров

Xiaomi открыла исходный код моделей MiMo-V2.6 Pro и Flash

Xiaomi открыла исходный код омнимодальных моделей MiMo-V2.6 Pro и Flash, предназначенных для координации агентов при создании и визуальном тестировании интерактивных 3D-сцен. Эти модели могут генерировать ассеты Blender, управлять роботизированными манипуляторами по данным с камер, создавать фронтенды и презентации, собирать видео и сочинять музыку в виде партитур и MIDI.

arxiv arXiv cs.AI · 2 ч назад · 9 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для агента ИИ в области научных исследований за счёт оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах научно-исследовательской деятельности в сфере ИИ и сохраняет только те улучшения, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.AI · 3 ч назад WebArena · 45.3% · 12 просмотров

Growing Harness превращает повторяющееся управление агентами в переиспользуемый код с помощью обучения, направляемого ошибками

Авторы представляют Growing Harness — парадигму обучения, которая изучает структуру управления агентом на основе обратной связи от задач, а не полагается на стандартные тяжеловесные контекстные обвязки. Преобразуя повторяющиеся решения по управлению в исполняемый код и оставляя вызовы LLM для семантического рассуждения, метод стремится создавать переиспользуемых специализированных агентов.

arxiv arXiv cs.AI · 3 ч назад · 9 просмотров

CliffCompaction снижает затраты на кодирование агентов на 50% при сохранении производительности

Исследователи представляют CliffCompaction, технику автокомпактизации, предназначенную для снижения затрат на долгосрочных кодовых агентах до 50% в рамках ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности сжатой информации через усечение, а не перефразирование.

arxiv arXiv cs.LG · 4 ч назад · 11 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для передового агента ИИ, занимающегося научными исследованиями, путём оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах ИИ-исследований и разработок (R&D) и сохраняет только те обновления, которые показывают наилучшие результаты на скрытых оценках.

media r/LocalLLaMA · 4 ч назад · 9 просмотров

Глубокий поиск и Moonshot AI сталкиваются с расследованием в Пекине из-за потенциальных утечек данных в Anthropic

Китайские регуляторы проводят расследование в отношении DeepSeek и Moonshot AI по поводу потенциальных утечек данных американской компании Anthropic. Это расследование следует за слухами о руководителях Kimi, хотя ситуация в настоящее время описывается как расследование, а не подтвержденные аресты.

arxiv arXiv cs.LG · 5 ч назад · 9 просмотров

CliffCompaction снижает затраты на долгосрочных задачах программирования для агентов до 50%, сохраняя производительность

Исследователи представляют CliffCompaction, метод автокомпактизации, разработанный для агентов, обрабатывающих миллионы токенов, который сокращает затраты до 50% в условиях ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности информации при усечении, а не перефразировании.

arxiv arXiv cs.AI · 5 ч назад · 10 просмотров

VideoX-Qwen представляет центрированную на данных структуру для редактирования видео по инструкциям

Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.

arxiv arXiv cs.CL · 6 ч назад · 12 просмотров

Agensh масштабирует организационный интеллект до 1024 агентов

Исследователи представляют Agensh, масштабируемую самоорганизующуюся многоагентную среду, которая устраняет узкое место центрального оркестратора, позволяя параллельным рабочим асинхронно брать подзадачи и объединять прогресс.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

TelecomGPT-R1: Единое постобучение для рассуждений в гетерогенных телекоммуникационных задачах

Исследователи представляют TelecomGPT-R1, семейство открытых унифицированных моделей рассуждений для телекоммуникаций, предназначенных для автоматизации инженерных задач путем анализа стандартов, конфигураций и журналов. Модель решает ограничения существующих универсальных и специализированных LLM посредством структурированного подхода, охватывающего протоколы, знания, моделирование и устранение неисправностей.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

Qwen выпустила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель с контекстом в 1 млн токенов

Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.

media MarkTechPost · 8 ч назад · 9 просмотров

Anthropic выпустила Claude Opus 5.5 с производительностью Fable 5.1 при стоимости на 40% ниже

Anthropic выпустила Claude Opus 5.5, первую модель в новой семье Claude 5.5, которая демонстрирует уровень производительности Claude Fable 5.1 в большинстве задач, но обходится на 40% дешевле в обслуживании, чем Opus 5.

lab xAI News · 10 ч назад · 15 просмотров

SpaceXAI использует Grok Bot для обработки роста тикетов на 175% без найма

После приобретения Cursor SpaceXAI интегрировала своего ИИ-агента Grok Bot в объединённую службу поддержки, что позволило команде справиться с ростом количества тикетов на 175% без увеличения штата. Компания избежала найма примерно 200 дополнительных сотрудников и снизила стоимость решения каждого тикета до диапазона от $0.20 до $0.30 благодаря использованию модели ценообразования Grok Bot, зависящей от объёма потребления.