Источник · Hugging Face Blog
lab Hugging Face Blog · 29 д назад · 44 просмотра

IBM выпустила.reasoning LLM Granite 4.2 с возможностями агентов

IBM выпустила Granite 4.2, семейство плотных декодер-только reasoning больших языковых моделей размером 3B, 8B и 30B. Эти модели обучены с нуля на примерно 15 триллионах токенов и имеют контекстное окно, расширенное до 512K токенов.

lab Hugging Face Blog · 29 д назад GPQA Diamond · 67.4% · 39 просмотров

QAH от Multiverse Computing позволяет 4-битной модели GPT-OSS превзойти её полнопрецизионный оригинал

Multiverse Computing представляет Quantization-Aware Healing (QAH), метод, который дистиллирует сжатые, квантованные большие языковые модели непосредственно из их исходных учителей до сжатия. Применённый к модели GPT-OSS 120B, сжатой до 60B параметров и квантованной до MXFP4, подход даёт модель, которая превосходит свою собственную полнопрецизионную версию bfloat16 в 7 из 9 бенчмарков.

lab Hugging Face Blog · 15 ч назад · 9 просмотров

AISI публикует подтверждённые результаты оценки шести передовых моделей по пяти бенчмаркам

Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.

lab Hugging Face Blog · 21 ч назад · 10 просмотров

Transformers добавляет поддержку GGUF через ядра ggml для локального вывода

Библиотека Transformers от Hugging Face теперь поддерживает загрузку квантованных моделей в формате GGUF, используя базовые ядра ggml для достижения производительности, близкой к llama.cpp. Эта интеграция позволяет разработчикам запускать квантованные контрольные точки непосредственно через стандартный API на основе PyTorch на поддерживаемом оборудовании.

lab Hugging Face Blog · 1 д назад · 11 просмотров

Создатель oMLX Джун Ким присоединился к Hugging Face для поддержки сообщества MLX

Джун Ким, создатель и сопровождающий проекта oMLX, присоединился к Hugging Face для поддержки сообщества MLX. Этот шаг направлен на обеспечение стабильности и ускорение разработки открытого проекта путем перевода его из побочного занятия в полностью поддерживаемую и финансируемую инициативу.

lab Hugging Face Blog · 2 д назад · 10 просмотров

tokenizers v1: кандидат в релизы обеспечивает ускорение кодирования в 3–30 раз за счёт разделения битового потока и кэширования

Библиотека tokenizers выпустила кандидат в релизы версии 1, который значительно улучшает производительность кодирования текста, устраняя узкие места в рабочих процессах обучения и обслуживания. Обновление сохраняет совместимость API с версией v0.23, обеспечивая существенное ускорение для десяти семейств моделей.

lab Hugging Face Blog · 2 д назад MMLU · 77.0% · 15 просмотров

Multiverse переосмысливает удаление блоков LLM как задачу Изинга для глубокого сжатия

Команда Multiverse опубликовала статью, в которой описывается метод, переформулирующий прунинг больших языковых моделей как задачу бинарной оптимизации с ограничениями, отображаемую на модель Изинга. Рассматривая блоки трансформера как спины с парными связями, выведенными из гессиана функции потерь, подход определяет оптимальные конфигурации удаления блоков без необходимости итеративного бенчмаркинга.

lab Hugging Face Blog · 8 д назад · 16 просмотров

ALTK-Evolve вводит руководства по согласованности для сокращения разрыва в надёжности агентов вдвое

Исследователи внедрили «руководства по согласованности» в систему ALTK-Evolve — новый механизм, предназначенный для устранения вариативности производительности LLM-агентов, которую часто скрывают стандартные метрики средней точности. Выявляя и стабилизируя точки принятия решений, склонные к изменению результатов, этот подход значительно повышает стабильность выполнения задач без ущерба для общей способности.

lab Hugging Face Blog · 9 д назад · 16 просмотров

TRL v1.14 AsyncGRPOTrainer обеспечивает синхронизацию только LoRA в рамках Hugging Face Jobs

TRL v1.14 добавляет поддержку LoRA для AsyncGRPOTrainer, позволяя обучать адаптер Low-Rank Adaptation и синхронизировать только этот небольшой файл с inference-воркерами vLLM. Эта архитектура разделяет задачи обучения и генерации на разных машинах, используя общий Storage Bucket в качестве файлового моста, что устраняет необходимость в NCCL или прямой сетевой коммуникации между узлами.

lab Hugging Face Blog · 13 д назад · 24 просмотра

Gradio выпускает Workflow1111, воссоздавая функции AUTOMATIC1111 в виде графа Gradio

Gradio выпустила Workflow1111 — проект, который воссоздает большинство функций stable-diffusion-webui от AUTOMATIC1111 с использованием фреймворка gr.Workflow. Приложение состоит из одного холста, содержащего одиннадцать медиапайплайнов, собранных из семидесяти трех узлов, охватывающих задачи преобразования текста в изображение, изображения в видео и различные этапы предварительной обработки.

lab Hugging Face Blog · 14 д назад · 41 просмотр

IBM выпустила модель Granite Time Series PatchTST-FM-r2 с SOTA результатами и коммерчески дружественной лицензией

IBM выпустила Granite Time Series PatchTST-FM-r2, базовую модель временных рядов с ~385 млн параметров, которая демонстрирует лучшие результаты в zero-shot режиме на лидерборде GIFT-Eval при использовании разрешительных коммерческих лицензий.

lab Hugging Face Blog · 15 д назад · 23 просмотра

Multiverse Computing предлагает самодистилляцию с учётом границ для точного отказа LLM в выполнении опасных запросов

В статье Multiverse Computing представлен метод обучения языковых моделей отказывать только в конкретных вредных подкатегориях темы, а не во всей категории целиком, что позволяет преодолеть ограничения грубых тематических ограничителей. Подход использует самодистилляцию с учётом границ вместе с восстановлением покрытия и доброкачественными данными из того же распределения, чтобы сохранить безопасность при одновременном снижении ложных отказов на легитимные запросы.

lab Hugging Face Blog · 20 д назад · 34 просмотра

NeoMME выпускает эффективные мультимодальные энкодеры с плотным и поздним взаимодействием при поиске

Исследователи представляют NeoMME, семейство из 260M и 800M многоязычных мультимодальных энкодеров, которые обрабатывают текст и сырые изображения с помощью одного двунаправленного Transformer. В отличие от генеративных визуальных языковых моделей, NeoMME не полагается на отдельные предварительно обученные визуальные башни или каузальные декодеры, обучая всю модель с нуля с использованием маскированного дискретного диффузионного объекта.

lab Hugging Face Blog · 20 д назад · 58 просмотров

Hugging Face выпустила funes для обеспечения долговременной локальной памяти для кодовых агентов

Hugging Face выпустила funes, инструмент, который преобразует существующие журналы сессий кодовых агентов в долговременный, доступный для поиска слой памяти для Claude Code, Codex, pi и Hermes. Он индексирует трассировки локально с помощью векторного и BM25 поиска, позволяя агентам извлекать точное происхождение данных без внешних сервисов.

lab Hugging Face Blog · 20 д назад · 25 просмотров

Дообучение LFM2.5-350M с помощью GRPO улучшает соблюдение схемы IFStruct

В руководстве демонстрируется дообучение модели Liquid AI LFM2.5-350M с использованием групповой относительной оптимизации политики (GRPO) для улучшения генерации структурированного вывода. Процесс включает обучение на подмножестве набора данных NVIDIA Nemotron и оценку производительности по бенчмарку IFStruct.

lab Hugging Face Blog · 20 д назад · 29 просмотров

OpenEnv воспроизводит модель акварельной живописи Суры Нарредди с помощью TRL

Инженер открыл исходный код воспроизведения вирусного проекта Суры Нарредди, который обучает модель программирования рисовать акварелью с использованием JavaScript и обучения с подкреплением. Реализация использует библиотеку TRL и OpenEnv для создания сквозного конвейера на Hugging Face для обучения, оценки и вывода.

lab Hugging Face Blog · 21 д назад · 33 просмотра

IBM и Confluent интегрируют модели Granite Time Series для вывода в реальном времени

IBM и Confluent интегрировали базовые модели IBM Granite Time Series Foundation Models (TSFM) в Confluent Cloud, обеспечивая прогнозирование и обнаружение аномалий в реальном времени непосредственно внутри Apache Flink.

lab Hugging Face Blog · 21 д назад · 28 просмотров

BenchMIRT проверяет бенчмарки LLM, разделяя сигналы безопасности и рассуждения

Исследователи представляют BenchMIRT, метод аудита бенчмарков больших языковых моделей на уровне отдельных промптов с использованием многомерной теории ответа на вопрос (Item Response Theory). Анализируя результаты работы 100 моделей и 34 000 вопросов, инструмент разделяет смешанные способности, такие как безопасность и общее рассуждение, которые часто искажают оценки в бенчмарках.

lab Hugging Face Blog · 22 д назад · 36 просмотров

Hugging Face выпустила 207 ядер WebGPU и инструмент для браузерного бенчмаркинга

Компания Hugging Face выпустила библиотеку @huggingface/kernels для загрузки и запуска оптимизированных ядер WebGPU из Hugging Face Hub, а также начальную коллекцию из 207 ядер. В релиз также вошёл Fleet — набор для браузерного бенчмаркинга GPU, который собирает данные о производительности и корректности с устройств пользователей.

lab Hugging Face Blog · 25 д назад · 36 просмотров

В рейтинг Open ASR добавлены датасеты Monsoon для хинди и индийского английского

Рейтинг Open ASR представил свои первые языки Глобального Юга с двумя новыми наборами данных для оценки: Monsoon en-IN (индийский английский) и Monsoon hi-IN (хинди). Эти дополнения устраняют недостаток демографического разнообразия в текущих бенчмарках, которые исторически фокусировались на европейских языках.