Все статьи
media r/LocalLLaMA · 12 д назад

SupraLabs выпустил модель SupraVL-Nano-900k для обработки изображений и языка

SupraLabs представил модель SupraVL-Nano-900k, полностью прозрачную модель из 900 тысяч параметров, обученную с нуля на наборе Flickr8k. Модель включает в себя CNN-энкодер, декодер стиля GPT-2 и метод объединения с помощью префикса, все компоненты которой полностью документированы и разработаны с целью образовательной ясности.

github llama.cpp · 13 д назад

Релиз llama.cpp b9724 с исправлением ошибок и бинарниками для разных платформ

Версия llama.cpp b9724 включает несколько исправлений ошибок и улучшений, таких как исправления сборки, предотвращение переполнения в функции area() и проверка целостности в функции get_u32(). Релиз предоставляет предварительно скомпилированные бинарники для macOS (arm64 и x64), Linux (x64, arm64, s390x, Vulkan, ROCm, OpenVINO, SYCL), Android (arm64), Windows (x64, arm64, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и openEuler (x86 и aarch64 с поддержкой ACL Graph), а также пакет интерфейса пользователя.

media r/LocalLLaMA · 13 д назад

Наблюдение за тем, как локальный ИИ-ассистент по голосу становится менее умным

Проверка на RTX 5060 Ti показала, что сокращение размера модели локального ИИ-ассистента по голосу с 9B до 0,8B приводит к резкому падению его способностей. Модель размером 9B хорошо справляется с координацией инструментов, в то время как более маленькие модели демонстрируют растущее количество сбоев: модель размером 4B пропускает вызов инструментов и делает предположения о фактах, модель размером 2B испытывает синтаксическую дрейф, а модель размером 0,8B не может выполнять функции агента, вызывая неправильные API или бесконечные циклы.

media r/LocalLLaMA · 13 д назад

GLM-5.2 — это новый ведущий открытый модельный вес на Индексе искусственного аналитического интеллекта

GLM-5.2 был признан ведущей открытой моделью на Индексе искусственного аналитического интеллекта. Этот признание отражает его производительность и возможности в контексте открытого ИИ-моделирования.

media r/LocalLLaMA · 13 д назад

Eagle3 появился для Qwen

Модель спекулятивного декодирования Eagle3 теперь доступна в последней версии llama.cpp через --spec-type draft-eagle3. Её необходимо использовать вместе с драфтовым моделью, например, Ex0bit-Qwen3.6-27B-PRISM-EAGLE3-GGUF, и включать с помощью -md или --model-draft. Производительность сравнима с draft-mtp, хотя поддержка тензорной параллелизма отсутствует и использование VRAM выше.

media r/LocalLLaMA · 13 д назад

Выпущена новая оценка агентов

АртIFICИАЛЬНАЯ АНАЛИТИКА представила новую оценку агентов, которая оценивает способность больших языковых моделей планировать и выполнять задачи. Claude Fable и GLM 5.2 заняли лидирующие позиции в своих соответствующих группах, демонстрируя сильную производительность на этом неиспользованном бенчмарке.

github llama.cpp · 13 д назад

llama.cpp release b9723 добавляет поддержку Qwen3.5 и Qwen3.6 Eagle3

Версия llama.cpp b9723 вводит поддержку моделей Qwen3.5 и Qwen3.6 через Eagle3. В выпуске включены функции восстановления точек контроля с задержкой для гибридных моделей и обновления API и соглашений по названиям. Доступны бинарные сборки для платформ macOS, Linux, Android, Windows и openEuler, с возможностью выбора CPU, Vulkan, OpenVINO, SYCL и ROCm.

media r/LocalLLaMA · 13 д назад

Кто-то использовал VibeThinker-3B вне бенчмарков?

Пользователь Reddit спрашивает о реальной производительности VibeThinker-3B за пределами бенчмарков, обращая внимание на отладку, программирование, логику, задержку и удобство использования. Модель доступна на Hugging Face и описана в статье на arXiv.

github llama.cpp · 13 д назад

Релиз LLaMA.cpp b9722: Исправления и бинарники для разных платформ

Версия LLaMA.cpp b9722 исправляет проблему с неограниченным значением n_discard в обработке серверного контекста. В релизе представлены предварительно скомпилированные бинарники для macOS, Linux, Android, Windows и openEuler, поддерживающие различные архитектуры и ускорения, такие как Vulkan, CUDA, OpenVINO и SYCL.

media r/LocalLLaMA · 13 д назад

Кто-то здесь использует две RTX 5090?

Пользователь спрашивает, есть ли у кого-то недавно собранная система из двух RTX 5090, отмечая, что их текущая система из двух RTX 3090 работает хорошо для разработки программного обеспечения. Они упоминают, что переход на две RTX 5090 является дорогостоящим и рассматривают свои розетки в общежитии как возможное ограничение.

media r/LocalLLaMA · 13 д назад

Отмечено цензурирование локальных LLM на Reddit

Пользователи сообщают, что локальные языковые модели отказываются отвечать на вопросы без ограничителей, что вызывает опасения по поводу цензурирования в распределённых системах ИИ. Вопрос был обнаружен в сообществе Reddit LocalLLaMA, где пользователи описывают случаи блокировки ответов на законные запросы.

media r/LocalLLaMA · 13 д назад

Многоуровневые рабочие процессы агентов в Word

Блог-пост описывает, как реализовать многоуровневые рабочие процессы агентов в Microsoft Word с использованием локальных моделей языковой обработки. В руководстве приведены шаги по настройке агентов для обработки и взаимодействия с несколькими документами в рамках одного окружения Word.

media r/LocalLLaMA · 13 д назад

EvoTensile: эволюционная настройка ядер AMD Tensile GEMM

EvoTensile использует эволюционные алгоритмы для настройки ядер GEMM для видеокарт AMD, повышая производительность размещения NT с 20 до 40 ТФЛОПС на Strix Halo. Это ускорение представляет собой значительный прогресс по сравнению с неоптимизированными ядрами, хотя и остается ниже теоретического предела в 59,4 ТФЛОПС.

media r/LocalLLaMA · 13 д назад

Охо-Сейт-Университет выпускает открытый Deep Research-агент QUEST-35B

Команда NLP Охо-Сейт-Университета выпустила QUEST-35B, открытый Deep Research-агент, обученный на примерно 32 картах H100 с использованием 8 000 синтетических образцов. Команда открыла доступ к рецепту обучения, коду, весам и наборам данных, при этом результаты тестирования показывают конкурентоспособную производительность по сравнению с ведущими закрытыми Deep Research-системами.

github llama.cpp · 13 д назад

llama.cpp Release b9721 Доступен для нескольких платформ

llama.cpp выпустил версию b9721, в которой доступны бинарники для macOS, Linux, Android, Windows и openEuler на различных архитектурах. В выпуске включены поддержка CPU, Vulkan, ROCm, OpenVINO, SYCL и HIP, а также отдельный пакет для интерфейса. Поддержка Apple Silicon с KleidiAI на данный момент отключена.

media r/LocalLLaMA · 13 д назад

Охо-Сейт-Университет выпускает открытый Deep Research-агент QUEST-35B

Исследователи из Охо-Сейт-Университета обучили агента Deep Research QUEST-35B с использованием приблизительно 32 GPU H100 и 8 000 синтетических образцов. Они опубликовали рецепт обучения, код, веса и датасеты, при этом результаты тестирования показывают конкурентоспособную производительность по сравнению с ведущими закрытыми системами Deep Research.

media r/LocalLLaMA · 13 д назад

GLM-5.2 теперь может работать локально в llama.cpp и Unsloth Studio

GLM-5.2, самый сильный открытый модель до сих пор, теперь может работать локально с помощью llama.cpp и Unsloth Studio. Модель с квантованием на 2 бита сохраняет ~82% точности после сокращения размера с 1,51 ТБ до 238 ГБ, что составляет 84% сокращение, и совместима с установками на 256 ГБ ОЗУ или VRAM.