Лаборатория · Alibaba (Qwen)
media MarkTechPost · 5 д назад · 24 просмотра

Alibaba Qwen выпускает Qwen3.8-Omni-Flash: агентную омнимодель с контекстом в 1M токенов

Команда Qwen от Alibaba выпустила Qwen3.8-Omni-Flash, свою первую омнимодель, разработанную вокруг агентных возможностей для понимания аудио-видео и использования инструментов. Модель принимает текстовые, изображенные, аудиовходные и видео данные для возврата текстовых выходов, обладая контекстным окном в 1M токенов и нативным вызовом функций.

media MarkTechPost · 28 д назад · 68 просмотров

Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next — 125B MoE с предпросмотром архитектуры Qwen4

Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next, мультимодельную модель Mixture-of-Experts с открытыми весами, предназначенную для демонстрации архитектуры будущей серии Qwen4. Чекпоинт сочетает в себе базовую модель на 125B параметров, таблицу N-граммных эмбеддингов на 51B и модуль многозадачного предсказания токенов на 4B, активируя лишь 6B параметров на каждый токен.

arxiv arXiv cs.AI · 5 ч назад · 10 просмотров

VideoX-Qwen представляет центрированную на данных структуру для редактирования видео по инструкциям

Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

Qwen выпустила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель с контекстом в 1 млн токенов

Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.

media r/LocalLLaMA · 1 д назад · 11 просмотров

Alibaba планирует ИИ-модель с 5–10 триллионами параметров и представляет новый чип

Alibaba объявила о планах разработки модели искусственного интеллекта, содержащей от 5 до 10 триллионов параметров. В рамках этого плана компания также представила новый собственный чип, разработанный для поддержки её инфраструктурных потребностей.

media MarkTechPost · 2 д назад · 14 просмотров

Alibaba Qwen выпускает унифицированную 7B модель Qwen-Image-2.1 для генерации и редактирования изображений

Команда Qwen от Alibaba выпустила Qwen-Image-2.1, унифицированную модель генерации изображений по тексту и их редактирования, которая объединяет предыдущие отдельные чекпоинты в единый диффузионный трансформер на 7B параметров.

media MarkTechPost · 3 д назад · 18 просмотров

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate с архитектурой Interleave

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate, модель синхронного перевода в реальном времени нового поколения, которая слушает живую речь и возвращает переведённый текст и аудио, пока говорящий ещё не закончил. В релизе представлена новая архитектура Interleave, предназначенная для снижения задержки и повышения качества перевода.

media r/LocalLLaMA · 4 д назад · 11 просмотров

Alibaba открыла исходный код медицинской ИИ-модели для обнаружения рака и почти 150 заболеваний

Alibaba выпустила модель медицинского искусственного интеллекта с открытым исходным кодом, способную выявлять рак и примерно 150 других медицинских состояний.

lab Hugging Face Blog · 9 д назад · 16 просмотров

TRL v1.14 AsyncGRPOTrainer обеспечивает синхронизацию только LoRA в рамках Hugging Face Jobs

TRL v1.14 добавляет поддержку LoRA для AsyncGRPOTrainer, позволяя обучать адаптер Low-Rank Adaptation и синхронизировать только этот небольшой файл с inference-воркерами vLLM. Эта архитектура разделяет задачи обучения и генерации на разных машинах, используя общий Storage Bucket в качестве файлового моста, что устраняет необходимость в NCCL или прямой сетевой коммуникации между узлами.

media Hugging Face Forums · 10 д назад · 23 просмотра

Исследование выявляет FragileTokens, не справляющиеся с контекстным копированием, несмотря на успешное прохождение изоляционных тестов

В исследовании описываются «FragileTokens» — элементы словаря моделей языка с открытым весом, которые успешно копируются при изоляции, но демонстрируют ошибки при встраивании в окружающий текст. Исследование подчеркивает, что буквальное сохранение идентичности не гарантируется стандартными изоляционными тестами, поскольку токены могут быть удалены, заменены или усечены внутри последовательностей.

arxiv arXiv cs.AI · 14 д назад SWE-bench Verified · 72.6% · 29 просмотров

ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами

ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.

arxiv arXiv cs.CL · 14 д назад SWE-bench Verified · 72.6% · 25 просмотров

ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление

Исследователи представляют ExecCritic — фреймворк, сочетающий структуру test-verify-revise с ролевым обучением с подкреплением для повышения эффективности кодогенерирующих агентов. Система разделяет создание тестов и исправление исходного кода: Test-агент генерирует тесты, специфичные для репозитория, а Repair-агент корректирует код на основе обратной связи от выполнения.

arxiv arXiv cs.LG · 16 д назад · 30 просмотров

Метод спекулятивной неопределённости снижает ошибки агентов программной инженерии с помощью гейтирования черновик-моделью

Авторы представляют Speculative Uncertainty (SU), технику, которая восстанавливает сигнал предсказательного сбоя для black-box LLM-агентов путём анализа только их выходных токенов, без необходимости доступа к логитам, весам или активациям. Инвертируя спекулятивное декодирование, небольшая открытая черновик-модель оценивает траекторию агента за один прямой проход для извлечения фазово-осознанных признаков и калибровки их по проверяемой цели.

arxiv arXiv cs.CL · 19 д назад · 36 просмотров

VisCAD выпускает набор фундаментальных моделей с мультимодальным интеллектом для промышленного САПР

Исследователи представляют VisCAD, набор фундаментальных моделей, предназначенный для обеспечения широкой обобщающей способности и сильных возможностей в области реалистичного проектирования промышленных изделий. Набор решает задачи генерации на уровне деталей из разнообразных входных данных, таких как рендеры и текст, а также генерации на уровне сборки с участием взаимодействующих деталей.

media r/LocalLLaMA · 20 д назад · 39 просмотров

AntLing открыл исходный код Ling-3.0-flash-Fin, модели с улучшенными финансовыми возможностями

Ant Group открыла исходный код Ling-3.0-flash-Fin, первой модели семейства Ant Ling с улучшенными финансовыми возможностями, разработанной совместно с ведущими финансовыми учреждениями и экспертами в этой области.

lab Hugging Face Blog · 20 д назад · 29 просмотров

OpenEnv воспроизводит модель акварельной живописи Суры Нарредди с помощью TRL

Инженер открыл исходный код воспроизведения вирусного проекта Суры Нарредди, который обучает модель программирования рисовать акварелью с использованием JavaScript и обучения с подкреплением. Реализация использует библиотеку TRL и OpenEnv для создания сквозного конвейера на Hugging Face для обучения, оценки и вывода.

arxiv arXiv cs.LG · 21 д назад SWE-bench Verified · 16.6% · 36 просмотров

CANOPY позволяет Qwen3-14B занять первое место в AppWorld с помощью RL только по результату

В статье представлен CANOPY (Coverage-ANchored On-PolicY RL) — протокол, решающий проблему недостатка сигналов и смещения политики в долгосрочном обучении с подкреплением для небольших открытых моделей. За счёт масштабирования исследования в рамках одной задачи и удержания обновлений, привязанных к KL-дивергенции, метод позволяет агентам эффективно учиться исключительно на основе проверки завершения задачи.