Open weights
media TLDR AI · 2 ч назад · 10 просмотров

Xiaomi открыла исходный код моделей MiMo-V2.6 Pro и Flash

Xiaomi открыла исходный код омнимодальных моделей MiMo-V2.6 Pro и Flash, предназначенных для координации агентов при создании и визуальном тестировании интерактивных 3D-сцен. Эти модели могут генерировать ассеты Blender, управлять роботизированными манипуляторами по данным с камер, создавать фронтенды и презентации, собирать видео и сочинять музыку в виде партитур и MIDI.

media Latent Space · 22 ч назад · 11 просмотров

Xiaomi выпустила MiMo-V2.6-Pro, ведущую открытую омнимодельную модель, обученную за $3 млн

Xiaomi выпустила серию MiMo-V2.6, представив нативно омнимодельные модели, включая MiMo-V2.6-Pro и MiMo-V2.6-Flash. Компания также запустила MiMo-V2.6-Pro-UltraSpeed, обеспечивающую скорость вывода до 20 раз выше при том же качестве.

media MarkTechPost · 1 д назад Terminal-Bench 2 · 69.7% · 9 просмотров

AWS Strands Agents выпускает Strands Harness с открытым исходным кодом при снижении стоимости токенов

Команда AWS Strands Agents выпустила Strands Harness, кросс-платформенный инструмент для агентов с открытым исходным кодом, доступный по лицензии Apache 2.0 для Python и TypeScript. Инструмент предназначен для устранения разрыва между прототипированием агентов в таких средах, как Claude Code или Codex, и их развертыванием с использованием пользовательских циклов.

lab Microsoft Research Blog · 2 д назад · 29 просмотров

Microsoft выпустила RetroChimera для предсказания ретросинтеза

Microsoft Research опубликовала и открыла исходный код RetroChimera, новой системы для предсказания ретросинтеза, которая объединяет две взаимодополняющие модели для предложения высококачественных путей синтеза. Система интегрирует R-SMILES 2, модель на основе Transformer для de-novo генерации, с NeuralLoc, моделью на основе графовых нейронных сетей (GNN), используя обученную стратегию ансамблирования для ранжирования предсказаний.

media MarkTechPost · 2 д назад · 14 просмотров

Alibaba Qwen выпускает унифицированную 7B модель Qwen-Image-2.1 для генерации и редактирования изображений

Команда Qwen от Alibaba выпустила Qwen-Image-2.1, унифицированную модель генерации изображений по тексту и их редактирования, которая объединяет предыдущие отдельные чекпоинты в единый диффузионный трансформер на 7B параметров.

lab Hugging Face Blog · 2 д назад · 10 просмотров

tokenizers v1: кандидат в релизы обеспечивает ускорение кодирования в 3–30 раз за счёт разделения битового потока и кэширования

Библиотека tokenizers выпустила кандидат в релизы версии 1, который значительно улучшает производительность кодирования текста, устраняя узкие места в рабочих процессах обучения и обслуживания. Обновление сохраняет совместимость API с версией v0.23, обеспечивая существенное ускорение для десяти семейств моделей.

lab Hugging Face Blog · 2 д назад MMLU · 77.0% · 15 просмотров

Multiverse переосмысливает удаление блоков LLM как задачу Изинга для глубокого сжатия

Команда Multiverse опубликовала статью, в которой описывается метод, переформулирующий прунинг больших языковых моделей как задачу бинарной оптимизации с ограничениями, отображаемую на модель Изинга. Рассматривая блоки трансформера как спины с парными связями, выведенными из гессиана функции потерь, подход определяет оптимальные конфигурации удаления блоков без необходимости итеративного бенчмаркинга.

media Interconnects · 2 д назад Artificial Analysis Intelligence Index · 45.0% · 17 просмотров

Китайские модели с открытым весом обгоняют американские аналоги по количеству загрузок и результатам бенчмарков

Автор представляет обзор состояния моделей с открытым весом, отмечая, что китайские ИИ-компании стали явными лидерами в этой области примерно с апреля 2025 года. Этот сдвиг подтверждается метриками загрузок на Hugging Face и результатами на бенчмарках оценки возможностей.

media r/LocalLLaMA · 4 д назад · 11 просмотров

Alibaba открыла исходный код медицинской ИИ-модели для обнаружения рака и почти 150 заболеваний

Alibaba выпустила модель медицинского искусственного интеллекта с открытым исходным кодом, способную выявлять рак и примерно 150 других медицинских состояний.

media r/LocalLLaMA · 5 д назад · 35 просмотров

inclusionAI выпускает модель взаимодействия Realtime-Venus на 9B параметров

inclusionAI выпустила систему Realtime-Venus на платформе Hugging Face, включающую два контрольных файла: Realtime-Venus-Omni и Realtime-Venus-Audio. Контрольный файл Omni представляет собой модель аудио-визуального взаимодействия на 9B параметров, адаптированную из MiniCPM-o 4.5, которая непрерывно наблюдает и слушает, чтобы решить, когда отвечать.

media r/LocalLLaMA · 5 д назад · 17 просмотров

Naive AI оценивается в $1,4 млрд, планирует выпуск LLM с открытым весом

Naive AI, стартап в режиме скрытой разработки, основанный профессором Университета Цинхуа Дай Цзифэном, завершил три раунда финансирования на общую сумму $400 млн, достигнув оценки более $1,4 млрд. Компания готовится выпустить свою первую большую языковую модель, также названную Naive, в виде релиза с открытым весом уже в этом месяце.

lab Tencent Hunyuan (HF) · 6 д назад · 23 просмотра

Tencent выпустила документальные парсеры WeVisDoc-2B и WeVisDoc-4B

Tencent выпустила WeVisDoc, сквозной документальный парсер для изображений страниц, дообученный на моделях Qwen3-VL. Система преобразует изображения страниц в структурированный Markdown, включая формулы LaTeX и HTML-таблицы.

lab Tencent Hunyuan (HF) · 6 д назад · 64 просмотра

Tencent выпустила WeVisDoc-4B, сквозной парсер документов

Tencent выпустила WeVisDoc-4B, сквозной парсер документов для изображений страниц, который преобразует страницы в структурированный Markdown с формулами LaTeX и HTML-таблицами. Модель, дообученная на базе Qwen3-VL-4B-Instruct, достигает общего балла 95.38 на OmniDocBench v1.6 и занимает первое место среди сравниваемых парсеров во всех четырех указанных настройках.

media Together AI Blog · 7 д назад · 16 просмотров

Together представила стратегию перехода от закрытых к открытым моделям

Together предлагает предприятиям фреймворк для миграции с закрытых ИИ-моделей на открытые модели (OSM) с использованием управляемых сервисов, стремясь снизить сложность и ускорить внедрение. Процесс включает обнаружение подходящих моделей через бенчмарки, их оценку посредством воспроизведения трафика, адаптацию промптов или весов и расчёт ROI для обоснования перехода.

media r/LocalLLaMA · 7 д назад · 18 просмотров

Отчёт Mozilla: открытые китайские ИИ-модели отстают от американских флагманов на 4 месяца

Согласно отчёту Mozilla, разрыв в разработке между открытыми китайскими ИИ-моделями и американскими флагманскими решениями сократился до четырёх месяцев. Несмотря на такой быстрый прогресс, модели продолжают уступать в некоторых бенчмарках.