Все статьи
arxiv arXiv cs.LG · 10 д назад

Фильтрованные конформные эллипсоиды для граф-ориентированных временных рядов

Новый метод, называемый фильтрованными конформными эллипсоидами, обеспечивает прогнозные множества для многомерных временных рядов, используя замороженный фильтр состояния для генерации прогнозных средних значений и ковариаций, а затем применяя раздельную конформную калибровку к оценкам Махаланобиса. Метод обеспечивает покрытие при наличии зависимости за счёт сжатия в квоте предиктивного закона, с теоретическими границами, полученными при условиях гауссовой проекции и наблюдаемости, и демонстрирует более тонкие эллипсоиды на граф-ориентированных тестах трафика по сравнению с статическими и нефильтрованными базовыми методами.

arxiv arXiv cs.LG · 10 д назад

TokenPilot: Эффективное управление контекстом для агентов LLM

TokenPilot снижает расходы на инференс на 61% до 87% как в изолированном, так и в непрерывном режимах, превосходя предыдущие системы по эффективности расходов, при этом сохраняя конкурентную производительность. Оно использует сжатие, учитывающее ввод, и эвакуацию, учитывающую жизненный цикл, для стабилизации промптов и эффективного управления сегментами контекста.

arxiv arXiv cs.LG · 10 д назад

Математический обзор анализа пространства форм в машинном обучении

Настоящий обзор представляет математическую структуру для анализа геометрических данных, объединяющую дифференциальную геометрию, статистику и машинное обучение. В нем описывается единый поток для представления форм, геодезических метрик, статистического анализа и обучения с геометрическим учетом, позволяющий изучать вариабельность форм и структурные траектории в популяциях и во времени. Применения охватывают биологию, медицину, антропологию и компьютерное зрение, подчеркивая трудности в обработке нелинейных и несогласованных геометрических вариаций.

arxiv arXiv cs.LG · 10 д назад

ExpRL: Исследовательская RL для среднего обучения LLM

ExpRL вводит новую методику среднего обучения для LLM, используя данные вопрос-ответ, написанные людьми, как основу вознаграждения. Вместо имитации ссылочных решений, она строит специфические для задачи критерии оценки для вознаграждения промежуточных шагов рассуждения, что позволяет лучше инициализировать спарсенные вознаграждения RL и превосходить SFT, спарсенный GRPO и самодистилляцию на задачах математического мышления.

arxiv arXiv cs.LG · 10 д назад

HAMON: Пассивная оптическая система прогнозирования

HAMON использует пассивную оптическую дифракцию для генерации прогнозов и превосходит цифровые базовые модели по ETTm2 на всех горизонтах и по ETTh2 на всех горизонтах, кроме самого длинного. Оно достигает на 14% меньшей ошибки MSE и работает без тренируемой цифровой смеси, опираясь вместо этого на физическое распространение оптических волн.

arxiv arXiv cs.LG · 10 д назад

KVEraser: Эффективное локальное удаление контекста в LLMs

KVEraser обеспечивает эффективное локальное удаление контекста в больших языковых моделях, заменяя только состояния кэша KV для удаленного участка на обученные направляющие состояния. Оно достигает почти полной переработки производительности на задачах в области применения и обеспечивает рост задержки на 24% по сравнению с ростом задержки в 17,6 раз при полной переработке, с увеличением скорости до 3--4 раз на задачах по вопросам длинных документов.

arxiv arXiv cs.LG · 10 д назад

Атака RING: использование дифференциальной конфиденциальности в распределённом обучении для скрытия сигналов бэкдора

Новая атака RING использует дифференциальную конфиденциальность в распределённом обучении для скрытия сигналов бэкдора при максимизации их воздействия. Она достигает 90,3% успешности атаки против передовых защит, что на 26,08 раз превышает базовые методы, и выявляет критическую уязвимость в DP-FL из-за встроенной маскировки вредоносных обновлений.

arxiv arXiv cs.LG · 10 д назад

Фаза в нейронных представлениях: внутренний тест Оппенгейма-Лима

Классификаторы изображений, такие как PRISM2D, GFNet и ViT-B/16, показывают, что фаза, а не модуль, определяет предсказания в скрытых слоях. ResNet-50 выявляет скрытый код знака в поздних блоках, что указывает на существование идентичности фазы/знака во всех архитектурах, хотя она выражается по-разному из-за механизмов активации и выдачи результатов.

arxiv arXiv cs.LG · 10 д назад

HABC улучшает RL-настройку VLAs с разреженными результатами

Hierarchical Advantage-Weighted Behavior Cloning (HABC) улучшает онлайн-RL-настройку агентов визуально-языковых систем за счёт использования отдельных критических голов для жизнеспособности и эффективности. Оно объединяет их выходы через состояние-адаптивный воротник и применяет веса на переходе, при этом интервенция-ориентированная присвоение кредитов предотвращает утечку контроля. В реальных экспериментах с роботами HABC повышает показатели успеха до 92%, 88% и 38% на трёх бимануальных задачах, превосходя базовые значения SFT на 36%, 44% и 12%.

arxiv arXiv cs.LG · 10 д назад

Геометрическая модель действий для обучения политик роботов

Геометрическая модель действий (GAM) позволяет политикам роботов мыслить о трехмерных физических взаимодействиях, перепрограммируя предобученную геометрическую основную модель. GAM разделяет GFM на наблюдательный кодировщик и предиктор причинно-следственных будущих состояний, затем направляет предсказанные будущие геометрические формы и действия через один и тот же основной слой, обеспечивая точные, устойчивые и эффективные результаты в манипуляции в симуляции и на реальных роботах.

arxiv arXiv cs.LG · 10 д назад

Точная оценка постериорного скоора для линейных обратных задач

В статье получена точная постериорная оценка в закрытой форме для линейных гауссовых обратных задач, что позволяет эффективно осуществлять выборку постериоров с помощью дезактивации. Вводится точная постериорная оценка (EPS), цель обучения, которая сохраняет структуру предобучения и обеспечивает превосходную производительность по метрикам точности, восприятию и распределения с меньшим числом оценок дезактиватора по сравнению с градиентными методами.

media r/LocalLLaMA · 10 д назад

Выпущен Qwable-v1 как дистиллят Claude Fable-5

Qwable-v1, открытая модель, дистиллированная из Fable-5 от Anthropic, теперь доступна в общественном доступе на Hugging Face. Она содержит 4659 прямых текстовых следов агентного кодирования из публичного корпуса Fable-5 и генерирует корректно сформированные вызовы <tool_use> в формате XML для инструментов, характерных для Claude, отражая исходную поверхность инструментов в своих весах.

media r/LocalLLaMA · 10 д назад

vLLM выпустил новый парсер потока для Qwen3+ в ночной версии

vLLM представил новый парсер потока для Qwen3+, доступный в его ночной сборке, который решает проблемы, такие как остановка на промежуточных этапах и сбой вызова потока инструментов из-за границ блоков. Обновление, по данным, устраняет эти проблемы при ограниченных тестах, повышая надежность для агентных рабочих процессов.

media r/LocalLLaMA · 10 д назад

HalBench проверяет 29 открытых моделей на сикофантизм и халлюцинации

HalBench оценивает 29 открытых моделей языковых моделей на специальном бенчмарке для сикофантизма и халлюцинаций. Qwen 3.6 и Gemma 4 превосходят более крупные модели, при этом Qwen 3.6 достигает 36,6% отклонения — выше, чем у GPT-5.4 и Gemini 3.1 Pro. Размер модели не коррелирует с честными ответами, что указывает на то, что архитектура и обучающие данные важнее, чем количество параметров.

blog Simon Willison · 10 д назад

Cloudflare CAPTCHA активируется только для запросов с амперсандом

Симон Виллисон настроил CAPTCHA от Cloudflare так, чтобы он активировался только для запросов поиска, содержащих хотя бы один амперсанд. Правило использует пользовательский фильтр: (http.request.uri.path wildcard r"\/search\/*" и http.request.uri.query contains "&"). Это позволяет простым запросам, таким как /search/?q=lemur, проходить без CAPTCHA.

blog Simon Willison · 10 д назад

datasette-agent 0.3a0 выпускается с согласия пользователя по операциям записи SQL

datasette-agent 0.3a0 вводит инструмент execute_write_sql, который запрашивает у пользователя разрешение перед записью в базы данных, обеспечивая соблюдение проверок разрешений. Обновление также улучшает чат datasette agent с поддержкой согласия пользователя, новые опции команды, такие как --unsafe для автоматического согласия, и текстовые выводы инструментов для отображения в командной строке.