Масштабное исследование более 100 000 ответов на запросы ИИ по 100+ брендам выявило трёхуровневую лестницу видимости брендов: глобальные бренды появляются в 73% ответов, средние бренды — в 44%, а узкоспециализированные бренды — лишь в 11%. Генеративные системы в основном цитируют корпоративные веб-сайты, YouTube является лидером среди некорпоративных источников, а лучшие обзоры и списки составляют 21% всех цитирований. Оценка настроения в упоминаниях брендов нестабильна и меняется в шесть раз чаще, чем просто упоминание.
Оптимизация генеративной системы: измерение видимости AI в поиске
Claude от Anthropic улучшает оценку гипотезы Римана; Meta выпускает Muse Glimmer; OpenAI запускает GPT-5.6-Cyber
Этот выпуск TLDR AI охватывает три крупных события: модель Claude от Anthropic значительно улучшила нижнюю границу для нулей, удовлетворяющих гипотезе Римана, Meta выпустила модель с открытыми весами Muse Glimmer, а OpenAI представила специализированную модель для кибербезопасности.
GPT-5 превосходит людей в формировании состояний веры через планирование
Новое исследование оценивает способность больших языковых моделей формировать конкретные состояния веры у других агентов посредством действий, а не диалога; эта способность называется Непрерывное планирование ToM (NCP-ToM). Используя фреймворк NCP-ExploreToM, исследователи протестировали шесть передовых моделей и участников-людей на 600 задачах, где агентам нужно было перемещать объекты или направлять персонажей для достижения целей веры.
В многошаговых диалогах LLM возникают аттракторные состояния
Исследование изучает, проявляют ли открытые дискуссии больших языковых моделей поведение, подобное аттракторному, анализируя траектории по семи моделям и двадцати спорным темам. Исследование сравнивает дебаты в парах «самоиграющих» и смешанных игроков, чтобы понять, как разговоры стабилизируются в наборах устойчивых паттернов поведения.
Закон ЕС о искусственном интеллекте требует водяных знаков текста, сгенерированного ИИ, с августа 2024 года
Закон ЕС о искусственном интеллекте требует, чтобы все системы искусственного интеллекта, генерирующие синтетический текст, включали водяные знаки, доступные для машинного чтения и обнаружения, используя устойчивые, взаимодействующие технические решения с двумя слоями. Это касается всех моделей ИИ, включая открытые, и распространяется на любые услуги, доступные гражданам ЕС, независимо от их местоположения. Несоблюдение требований может привести к штрафам в размере до 35 миллионов евро или доли годового дохода, при этом поставщики моделей ИИ, представляющих системную угрозу, подвергаются повышенной ответственности.
MacAgentBench запускает бенчмарк AI-агента для macOS
MacAgentBench представляет всесторонний бенчмарк, включающий 676 задач по 25 приложениям, 60% из которых включают взаимодействие как с графическим интерфейсом, так и с командной строкой. Используя детерминированные правилу-ориентированные оценки и оценку с использованием мелких контрольных точек, было установлено, что Claude Opus 4.6 на OpenClaw достигает 73,7% Pass@1, в основном благодаря своей библиотеке навыков, а не архитектуре платформы.