Все статьи — korshunov.ai

Все статьи Страница 1 / 106

Пользователь ищет советы по запуску локальных LLM на слабом оборудовании

Пользователь Reddit просит рекомендации по запуску небольших локальных языковых моделей и потенциально агентных задач, таких как Hermes, на старом MacBook Pro с ограниченными ресурсами.

media r/LocalLLaMA · 4 ч назад

SpectralQuant Qwen3.5 0.8B Q4_K_M восстанавливает 96,5% разрыва с BF16

Компания Spectral Labs выпустила кандидата в релизы для калибровки-осознанного квантования Q4_K_M модели Qwen3.5 0.8B, используя новый метод под названием SpectralQuant. Этот подход направлен на то, чтобы стандартные форматы Q4_K_M вели себя ближе к более крупным форматам квантования, сохраняя при этом совместимость с llama.cpp.

media Ahead of AI · 5 ч назад

Настройка локального агента для программирования с использованием инструментов с открытым исходным кодом

Эта статья представляет собой руководство по настройке полностью локальной стека агентов для программирования, готового к промышленной эксплуатации, с использованием инструментов с открытым исходным кодом и больших языковых моделей с открытыми весами. В ней подробно описывается, как объединить локально развернутую LLM с инструментом для программирования, способным читать файлы, вносить изменения, выполнять команды и проверять результаты.

media r/LocalLLaMA · 5 ч назад

Голова диффузии Orthrus, обученная на Qwen 3.5/3.6 и Gemma 4, скоро выйдет

Проект Orthrus готовится выпустить поддержку моделей Qwen 3.5, Qwen 3.6 и Gemma 4 с использованием подхода диффузионной головы. Команда завершила тестирование и в настоящее время настраивает конвейер выпуска.

media r/LocalLLaMA · 5 ч назад

Пользователь Reddit обнаружил новый режим работы с изображениями в приложении DeepSeek

Пользователь Reddit заметил новый режим работы с изображениями в приложении DeepSeek, что вызвало предположения о скором выпуске модели, способной анализировать изображения. Пользователь уточнил, что эта функция не является инструментом OCR (оптического распознавания символов), поскольку она успешно описывает изображения, не содержащие текста.

media r/LocalLLaMA · 5 ч назад

Сообщения о 96 ГБ VRAM у RTX 5090 из хуацяньбэй в Шэньчжэне

Посетители электронного рынка Хуацяньбэй в Шэньчжэне столкнулись с сообщениями и потенциальными предложениями по модифицированным видеокартам Nvidia RTX 5090, оснащенным 96 гигабайтами видеопамяти. Один из продавцов указал, что такая переделанная Blackwell RTX 6000 будет стоить примерно $8 200, включая 36 000 юаней за базовую карту и дополнительные 20 000 юаней за апгрейд памяти.

media r/LocalLLaMA · 5 ч назад

Пользователь просит лучшие модели для кодирования на одном DGX Spark

Пользователь Reddit с одним DGX Spark, оснащённым 128 ГБ объединённой памяти, ищет рекомендации по улучшенным моделям для кодирования; в настоящее время использует StepFun step-3.7-flash и варианты Qwen 3.6.

media r/LocalLLaMA · 5 ч назад

Обсуждение в Reddit о производительности дообучения Qwen

Пользователь Reddit отмечает, что хотя дообучение моделей Qwen является популярной практикой, существует заметная нехватка положительных отзывов об их производительности. Пользователь задаётся вопросом, есть ли какие-либо дообученные модели Qwen, которые действительно превзошли возможности базовой модели.

media r/LocalLLaMA · 5 ч назад

Опубликованы модель и статья DeepSeek-V4-Pro-DSpark

Компания DeepSeek выпустила модель DeepSeek-V4-Pro-DSpark на платформе Hugging Face, а также сопроводительную техническую статью.

media r/LocalLLaMA · 5 ч назад

Дообучение модели LiquidAI LFM2.5-230M на наборах данных Fable-5 для программирования

Пользователь дообучил модель LiquidAI LFM2.5-230M на наборах данных Fable-5 для программирования и выпустил её в формате GGUF для локального использования.

media r/LocalLLaMA · 5 ч назад

llama.cpp PR #20793: Возвращение меньшего количества синхронизаций при разделённых вычислениях

Pull request #20793 возвращает уменьшение синхронизации при операциях разделённых вычислений в llama.cpp, в первую очередь направлено на улучшение производительности CUDA. Изменения включают замену синхронных копий на асинхронные и ослабление требований к синхронизации между копиями входных данных на поддерживаемых бэкендах.

github llama.cpp · 5 ч назад

Выпуск llama.cpp b9828: улучшения Flash Attention для OpenCL и новые бинарные файлы

Выпуск llama.cpp b9828 вносит значительные улучшения в OpenCL, конкретно перерабатывая ядра Flash Attention для точности f16 и f32. Это обновление включает новые ядра предварительного прохода префилла и поддержку форматов квантования q4_0 и q8_0.

media r/LocalLLaMA · 6 ч назад

Пользователь спрашивает, когда поддержка объединённых DeepSeek V4 Flash и MiniMax M3 появится в llama.cpp

Пользователь Reddit запрашивает примерные сроки официального слияния поддержки моделей DeepSeek V4 Flash и MiniMax M3 в основной репозиторий llama.cpp.

media r/LocalLLaMA · 6 ч назад

STT, способный бросить вызов Dragon Professional на Windows

Пользователь Reddit ищет локальные решения для преобразования речи в текст на основе LLM для Windows, которые могут соперничать с Dragon Professional, особенно в части редактирования вставленного текста и загрузки слов во время записи.

media r/LocalLLaMA · 6 ч назад

Ornith-1.0-35B Q3_K_M: ~17 ГБ VRAM, проверено по KLD против BF16

Автор квантовал модель deepreinforce-ai/Ornith-1.0-35B до формата Q3_K_M, уменьшив её размер примерно до 17 ГБ VRAM, сохранив поведенческую валидность через проверки расхождения Кульбака-Лейблера.

media r/LocalLLaMA · 6 ч назад

ContextForge: локальный SDK для долговременной памяти, который действительно выдерживает длительные запуски

ContextForge — это новый SDK, предназначенный для обеспечения практически неограниченного контекста для LLM без перегрузки окна промпта. Он решает распространенную проблему сбоев систем долговременной памяти во время длительных запусков, рассматривая окно контекста как динамический рабочий набор, а не постоянное хранилище.

media r/LocalLLaMA · 6 ч назад

Устранение неполадок с P2P при разделении 4x5060 Ti

Инженер облачных систем сообщает, что использование одной карты PCIe x16 с одним разветвителем 4x4 для подключения четырёх GPU создаёт узкое место пропускной способности для связи peer-to-peer (P2P). Этот узкий момент насыщает сеть, соединяющую карты, что приводит к производительности хуже, чем при отключённом P2P.

media r/LocalLLaMA · 6 ч назад

Пользователь спрашивает о дистилляции моделей для агентного доказательства теорем

Пользователь на r/LocalLLaMA рассматривает возможность самостоятельного хостинга моделей для агентного доказательства теорем с целью снижения затрат, так как у него есть финансирование оборудования, но нет кредитов LLM. Он предлагает дистиллировать возможности из большей модели в меньшую, подходящую для узкоспециализированных случаев использования, таких как Rocq, отмечая отсутствие существующих моделей для этого конкретного языка.

blog Simon Willison · 6 ч назад

Дин У. Болл о динамике индустрии ИИ и глобальных рынках

Дин У. Болл подчеркивает критическую динамику отрасли, при которой высокие затраты на обучение моделей уровня frontier окупаются лишь в узком окне после выпуска, прежде чем конкуренция сожмет маржу.

media r/LocalLLaMA · 6 ч назад

Пользователь приобрёл б/у Minisforum MS-S1 Max для локальных LLM-нагрузок

Пользователь делится решением приобрести слегка б/у Minisforum MS-S1 Max с 128 ГБ памяти примерно за US$2800, указывая рост стоимости оборудования Apple и закрытых моделей как основные мотивы. Автор положительно оценивает эту покупку по сравнению с новым Geekom A9 Mega, выделяя конкретные преимущества MS-S1: сеть 10Gbe, USB4v2 со скоростью 80 Гбит/с, слот PCIe и внутренний блок питания.