Все статьи — korshunov.ai

Все статьи Страница 1 / 90

Модели речи-текста латентно транскрибируют речь в промежуточных слоях

Модели речи-текста, встроенные друг в друга, проходят фазу неявной транскрипции, при которой речевые слова превращаются в декодируемые текстовые токены в промежуточных слоях, несмотря на отсутствие обучения по распознаванию речи. До 77% данных показывают, что речевое слово появляется как наиболее вероятный текстовый предсказываемый токен, после чего происходит переход к текстовому предсказанию следующего слова, прежде чем возвращение к речи. Это поведение влияется встроенными процессами обучения и инициализацией текстовых моделей, и коррелирует с производительностью по знанию речи.

arxiv arXiv cs.LG · 12 ч назад

Недостатки приложения с интеграцией LLM показывают пробелы в тестировании

Помощник по поиску аренды с функциями LLM и поддержкой нескольких рынков сталкивался с постоянными дефектами пользователей, несмотря на 1553 прошедших автоматизированных тестов. Анализ 252 коммитов по устранению багов показал, что 44% исправлений происходили в четырех незамеченных местах: в среде браузера, в неподходящих рынках, в цепочках конечных процессов и на уровне всей системы. Исправление без защиты на месте привело к тому, что дефект был выпущен дважды, что подчеркивает необходимость целенаправленного тестирования на этих границах.

arxiv arXiv cs.LG · 12 ч назад

Fed-CausalDiff: Разделенная синхронизация для распределенной симуляции действий

Fed-CausalDiff представляет федеративную систему каскадного диффузии, которая позволяет проводить симуляцию действий и оценку политик в распределенных средах. Она разделяет эволюцию скрытого состояния на глобальные и локальные компоненты, что позволяет достигать разделенной синхронизации, снижая стоимость передачи данных, при этом сохраняя точность каскадного вывода.

media r/LocalLLaMA · 12 ч назад

SDXL работает локально в браузере на WebGPU, открытый исходный код

Браузерное расширение позволяет генерировать изображения локально с использованием моделей SDXL через WebGPU, работающих на видеокарте пользователя без дополнительных настроек. Инструмент поддерживает два варианта: SDXL-Lighting fp16 (7 ГБ) и версия 4-бит (3,6 ГБ), при этом требуется не менее 8 ГБ VRAM для полной модели и браузер с поддержкой WebGPU (Chrome/Edge 122+ или последняя версия Firefox).

arxiv arXiv cs.LG · 13 ч назад

Глубокое обучение для распознавания жестов и перевода в индийских языках

Двухэтапная модель глубокого обучения классифицирует видеофрагменты индийского жестового языка на английские слова с использованием тонко настроенного трансформера VideoMAE, достигая точности 99% на обучающем и 78% на валидационном наборах данных из 13 классов. Прогнозируемые английские метки переводятся на хинди, телугу и бенгали с использованием многопрофильной модели NLLB-200 от Meta AI, при этом веб-демо позволяет пользователям загружать видео и получать результаты в разных языках.

arxiv arXiv cs.LG · 13 ч назад

Предварительная обработка на стороне запроса повышает точность edge AI

Структурированный фреймворк запроса повышает точность локальных моделей языковой модели при мониторинге окружающей среды за счет преобразования сырых данных сенсоров в обогащенные текстовые представления. Оценки на датасетах в помещении и на улице показывают, что точность локальных моделей увеличивается с 50,9% до 81,7% в помещении и с 63,7% до 89,3% на улице при использовании обогащенных запросов, при этом задержка остается низкой — около 0,22 секунд в режиме без цепочки мыслей.

arxiv arXiv cs.LG · 13 ч назад

Эффект ножниц: расширение разнообразия ухудшает устойчивость переноса

Разнообразие входных данных, распространённая практика в атаках на перенос, повышает успех на стандартных переносчиках, но снижает его на устойчивых. Этот зависимый от режима эффект, называемый эффектом ножниц, обусловлен геометрией градиентов, при этом операции масштабирования ухудшают сопоставимость в устойчивых моделях. Без обучения правило (CG-DI) корректирует разнообразие на основе локальной согласованности градиентов, чтобы сохранить успех атаки на разных типах переносчиков.

arxiv arXiv cs.LG · 13 ч назад

HERTA: Автоматизированный тест на уязвимости в фреймворках полной гомоморфной криптографии

HERTA — первый автоматизированный инструмент для тестирования фреймворков полной гомоморфной криптографии. Он использует метаморфный тест с новыми отношениями, выведенными из семантики FHE, для обнаружения глубоких логических ошибок, которые могут незаметно испортить зашифрованные вычисления. Оценка на трех промышленных фреймворках выявила 21 ранее неизвестную ошибку, несколько из которых были подтверждены и исправлены разработчиками, что имеет значительные последствия для безопасности и целостности сервиса.

arxiv arXiv cs.LG · 13 ч назад

Устойчивые диффузионные модели через взвешенное удаление шума, основанное на расхождении

Новый метод обучения заменяет потерю MSE в диффузионных моделях на преобразование, основанное на f-расхождении, создавая устойчивый заместитель, который улучшает производительность при загрязнении данных. Метод использует локальные конструкции расхождения под гауссовым обратным ядром DDPM, что приводит к обучению по одномерной функции ошибки удаления шума, при ограниченных влияниях расхождений, подавляющих большие ошибки и повышающих стабильность.

arxiv arXiv cs.LG · 13 ч назад

Кадровый устойчивый оптимизационный фреймворк

Кадровый устойчивый оптимизационный (GRO) вводит глубокую генеративную модель для определения множеств неопределенности, захватывая нелинейные корреляции, асимметрию и мультимодальность. Пятиуровневая оценочная система оценивает генеративные множества неопределенности на основе нейронных сетей по точности восстановления, соответствию распределению, регулярности скрытого пространства, устойчивой значимости и вычислительной применимости, эксперименты подтверждают эффективность GRO в задачах планирования производства и размещения объектов.

arxiv arXiv cs.LG · 13 ч назад

Введение температуры квантового измерения для стабилизации обучения гибридных квантовых нейронных сетей

Вводится управляемый масштабный параметр, называемый температурой квантового измерения (QMT), для пересчета выходов квантовых измерений в гибридных квантовых нейронных сетях. Этот подход уменьшает сжатие логитов, вызванное измерением, повышая величину градиента и стабильность во время обучения, не изменяя квантовую схему или операторы измерения. Эксперименты показывают улучшение разделения логитов, силы градиента и точности классификации в задачах классификации белков и изображений.

arxiv arXiv cs.LG · 13 ч назад

Глубокая сетевая структура для гомогенизации пьезоэлектрических композитов

Предлагается пьезоэлектрическая глубокая сетевая структура (PDMN) для эффективной гомогенизации двухфазных пьезоэлектрических композитов. Архитектура встраивает электромеханические уравнения гомогенизации, позволяя делать физически обоснованные, полуаналитические прогнозы с вычислительной стоимостью на три порядка ниже, чем при прямом численном моделировании, что подтверждено на композитах PVDF-LiNbO3 и вязко-пьезоэлектрических композитах при нелинейной нагрузке.

arxiv arXiv cs.LG · 13 ч назад

Концептуально-ограниченное обучение промптов для адаптации CLIP в условиях малообучающих данных

CCPL представляет легкую архитектуру, которая фиксирует промпты классов к замороженным концептуальным прототипам, улучшая адаптацию CLIP в условиях малообучающих данных. Оно достигает лучшего показателя базовой-новой производительности на DTD и EuroSAT по сравнению с CoOp, с постоянными улучшениями за счёт регуляризации в пространстве текста, хотя результаты варьируются в зависимости от датасета и протокола.

arxiv arXiv cs.LG · 13 ч назад

Стационарные устойчивые игры в среднем поле при несоответствии моделей

Эта статья вводит стационарную структуру игр в среднем поле, которая напрямую включает неопределенность распределения моделей в динамике, связанной с популяцией. В ней устанавливается устойчивое динамическое принцип динамического программирования, доказывается существование стационарного устойчивого равновесия и представлен первый алгоритм с гарантиями сходимости. Решение в среднем поле аппроксимирует равновесия конечной популяции и предоставляет явные неасимптотические границы погрешности при неопределенности моделей.

arxiv arXiv cs.LG · 13 ч назад

Классификация задач без обучения для объединения многозадачных моделей

SiM обеспечивает динамическое распределение в объединении многозадачных моделей без дополнительного обучения или доступа к идентификаторам задач. Он использует аппроксимации на многообразии, основанные на SVD, и проецирует тестовые входы на заранее вычисленные многообразия задач, чтобы направлять входы на соответствующих экспертов, повышая производительность и сокращая разрыв до уровня отдельных экспертов.

arxiv arXiv cs.LG · 13 ч назад

Важность-взвешенная на-политическая дистилляция устраняет смещение позиции

На-политическая дистилляция (OPD) страдает от смещения позиции, при котором поздние токены обеспечивают плохое обучение. Мы вводим Важность-взвешенную на-политическую дистилляцию (IW-OPD), которая присваивает веса на основе распределения, приоритизируя ранние токены. IW-OPD сходится быстрее и достигает до 6,9 точек роста производительности на AIME-2025.

arxiv arXiv cs.LG · 13 ч назад

Масштабируемые байесовские модели для обнаружения вспышек на звездах

Генеративная заменительная архитектура, использующая вариационный автоэнкодер, аппроксимирует гауссовы предпосылки, избегая дорогостоящих операций с ковариационными матрицами. Архитектура VAE+Hidden Markov Model позволяет быстро и масштабно обнаруживать вспышки на звездах в больших астрономических временных рядах, сохраняя структурную точность по сравнению с точными моделями, при значительном сокращении вычислительного времени.

arxiv arXiv cs.LG · 14 ч назад

Малые языковые модели превосходят передовые крупные языковые модели по извлечению отношений

Финетурированный модель Qwen2.5 с 0,5 миллиарда параметров достигает 0,83 микроФ1 в извлечении отношений в общей области, превосходя нулевую версию GPT-5.4 и Claude Sonnet 4.6. На литературных тестах она достигает 0,92 на датасете Биографический, превосходя GPT-5.4 и превосходя передовые модели по точности, демонстрируя, что адаптированные к задаче малые модели могут обеспечивать высокую производительность при минимальных затратах на оборудование и приватность.

media r/LocalLLaMA · 14 ч назад

Я разработал Windows Copilot в виде бесплатной OpenAI-совместимой API

Пользователь создал локальную API, которая имитирует функциональность GPT-4, совместимую с OpenAI, используя бесплатный сервис Microsoft Copilot. Инструмент авторизуется в аккаунте Microsoft один раз, работает локально на устройстве Windows и предоставляет сервер по адресу http://localhost:8000/v1, поддерживающий потоковые и многократные диалоги без необходимости API-ключа или оплаты. Инструмент предназначен для личного и образовательного использования и доступен по ссылке https://github.com/sums001/Windows-Copilot-API.

blog Simon Willison · 14 ч назад

Том Макврайт о случайной анонимности в заявках на работу

Том Макврайт отмечает, что все больше заявок на работу включают содержимое, сгенерированное с помощью языковых моделей, включая портфолио и проекты на GitHub с фальшивыми сообщениями о коммитах. Он отмечает, что такие заявки не раскрывают мало о кандидатах, поскольку они не содержат личной искренности и искреннего самовыражения.