Alibaba анонсировала Qwen 4 на конференции Apsara
Alibaba официально объявила о выпуске Qwen 4 в ходе конференции Apsara.
Alibaba официально объявила о выпуске Qwen 4 в ходе конференции Apsara.
Команда Qwen от Alibaba выпустила Qwen3.8-Omni-Flash, свою первую омнимодель, разработанную вокруг агентных возможностей для понимания аудио-видео и использования инструментов. Модель принимает текстовые, изображенные, аудиовходные и видео данные для возврата текстовых выходов, обладая контекстным окном в 1M токенов и нативным вызовом функций.
Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next, мультимодельную модель Mixture-of-Experts с открытыми весами, предназначенную для демонстрации архитектуры будущей серии Qwen4. Чекпоинт сочетает в себе базовую модель на 125B параметров, таблицу N-граммных эмбеддингов на 51B и модуль многозадачного предсказания токенов на 4B, активируя лишь 6B параметров на каждый токен.
Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.
Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.
Alibaba объявила о планах разработки модели искусственного интеллекта, содержащей от 5 до 10 триллионов параметров. В рамках этого плана компания также представила новый собственный чип, разработанный для поддержки её инфраструктурных потребностей.
Команда Qwen от Alibaba выпустила Qwen-Image-2.1, унифицированную модель генерации изображений по тексту и их редактирования, которая объединяет предыдущие отдельные чекпоинты в единый диффузионный трансформер на 7B параметров.
Qwen выпустила модель Qwen-Image-2.1 с открытыми весами, унифицированную модель, предназначенную как для генерации, так и для редактирования изображений.
Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate, модель синхронного перевода в реальном времени нового поколения, которая слушает живую речь и возвращает переведённый текст и аудио, пока говорящий ещё не закончил. В релизе представлена новая архитектура Interleave, предназначенная для снижения задержки и повышения качества перевода.
Alibaba выпустила модель медицинского искусственного интеллекта с открытым исходным кодом, способную выявлять рак и примерно 150 других медицинских состояний.
Модель Qwen3.8 Max (0902) достигла оценки 45 в Интеллектуальном индексе Artificial Analysis, вернув себе первое место в китайском рейтинге.
TRL v1.14 добавляет поддержку LoRA для AsyncGRPOTrainer, позволяя обучать адаптер Low-Rank Adaptation и синхронизировать только этот небольшой файл с inference-воркерами vLLM. Эта архитектура разделяет задачи обучения и генерации на разных машинах, используя общий Storage Bucket в качестве файлового моста, что устраняет необходимость в NCCL или прямой сетевой коммуникации между узлами.
В исследовании описываются «FragileTokens» — элементы словаря моделей языка с открытым весом, которые успешно копируются при изоляции, но демонстрируют ошибки при встраивании в окружающий текст. Исследование подчеркивает, что буквальное сохранение идентичности не гарантируется стандартными изоляционными тестами, поскольку токены могут быть удалены, заменены или усечены внутри последовательностей.
ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.
Исследователи представляют ExecCritic — фреймворк, сочетающий структуру test-verify-revise с ролевым обучением с подкреплением для повышения эффективности кодогенерирующих агентов. Система разделяет создание тестов и исправление исходного кода: Test-агент генерирует тесты, специфичные для репозитория, а Repair-агент корректирует код на основе обратной связи от выполнения.
Авторы представляют Speculative Uncertainty (SU), технику, которая восстанавливает сигнал предсказательного сбоя для black-box LLM-агентов путём анализа только их выходных токенов, без необходимости доступа к логитам, весам или активациям. Инвертируя спекулятивное декодирование, небольшая открытая черновик-модель оценивает траекторию агента за один прямой проход для извлечения фазово-осознанных признаков и калибровки их по проверяемой цели.
Исследователи представляют VisCAD, набор фундаментальных моделей, предназначенный для обеспечения широкой обобщающей способности и сильных возможностей в области реалистичного проектирования промышленных изделий. Набор решает задачи генерации на уровне деталей из разнообразных входных данных, таких как рендеры и текст, а также генерации на уровне сборки с участием взаимодействующих деталей.
Ant Group открыла исходный код Ling-3.0-flash-Fin, первой модели семейства Ant Ling с улучшенными финансовыми возможностями, разработанной совместно с ведущими финансовыми учреждениями и экспертами в этой области.
Инженер открыл исходный код воспроизведения вирусного проекта Суры Нарредди, который обучает модель программирования рисовать акварелью с использованием JavaScript и обучения с подкреплением. Реализация использует библиотеку TRL и OpenEnv для создания сквозного конвейера на Hugging Face для обучения, оценки и вывода.
В статье представлен CANOPY (Coverage-ANchored On-PolicY RL) — протокол, решающий проблему недостатка сигналов и смещения политики в долгосрочном обучении с подкреплением для небольших открытых моделей. За счёт масштабирования исследования в рамках одной задачи и удержания обновлений, привязанных к KL-дивергенции, метод позволяет агентам эффективно учиться исключительно на основе проверки завершения задачи.