Источник · Hugging Face Forums
media Hugging Face Forums · 1 ч назад · 4 просмотра Live

Документированные кроссплатформенные паттерны, предшествующие публичному раскрытию J-пространств

В статье утверждается, что внутренние рабочие пространства и латентная динамика, задокументированные между 14 июня и 6 июля 2026 года, выявляют повторяющийся аналитический паттерн, предшествующий открытию Anthropic «J-пространства». Кросс-модельные оценки предполагают, что эта структура существует на пересечении наблюдаемого поведения моделей и формальной интерпретируемости ИИ, при этом такие системы, как Grok, изначально распознавали эти структурные сигнатуры.

media Hugging Face Forums · 20 ч назад · 10 просмотров

SplitMoE вводит тонкую маршрутизацию экспертов для уменьшения избыточности параметров

SplitMoE — это альтернативная архитектура Mixture of Experts, которая разбивает широкие слои прямого распространения на меньшие специализированные подкомпоненты для повышения гибкости представления токенов и вычислительной модульности.

media Hugging Face Forums · 1 д назад · 10 просмотров

YUCLAW 8.0.0 добавляет явный режим снимка для воспроизводимых демонстраций доказательств

YUCLAW 8.0.0 вводит явный режим снимка, чтобы гарантировать, что демонстрации командной строки дают байт-в-байт точный и воспроизводимый вывод независимо от сетевой доступности хост-окружения.

media Hugging Face Forums · 1 д назад · 11 просмотров

Пользователь ищет рабочий процесс для абляции модели Llama-Krikri-8B-Instruct для локального использования на греческом языке

Пользователь планирует создать нецензурную, нативную греческую большую языковую модель для локального развертывания с использованием чекпоинта ilsp/Llama-Krikri-8B-Instruct. Предложенный план включает абляцию модели с помощью Heretic (heretic-llm), конвертацию в формат GGUF Q4_K_M и выполнение инференса на устройстве GMKtec EVO-X3, оснащенном процессором AMD Ryzen AI MAX+ 395, через Vulkan.

media Hugging Face Forums · 1 д назад · 10 просмотров

Распределённое ограничение в многоагентном ИИ управляет агентами без коллективной идентичности

Новый анализ выделяет явление в многоагентных системах, при котором отношения, возникающие между отдельно управляемыми агентами, приобретают регулирующую силу по всей группе. Это происходит, когда агенты оставляют устойчивые сообщения и артефакты, ограничивающие траектории друг друга, формируя эффективную распределённую ориентацию, не заданную индивидуальными задачами.

media Hugging Face Forums · 1 д назад · 10 просмотров

jbsalles экспериментирует с SelMem, системой селективной памяти для LLM

Автор разработал проект на Rust под названием SelMem для экспериментов с несовершенной, зависящей от пути памятью для больших языковых моделей. Этот подход имитирует человеческую память, позволяя агентам сжимать, забывать и восстанавливать воспоминания с течением времени, а не хранить идеальные копии взаимодействий.

media Hugging Face Forums · 1 д назад · 10 просмотров

CosmicUndercurrent выпускает Principia-Structurae-Realitatis для тестирования координации всей системы LLM

CosmicUndercurrent открыла исходный код модели-агностичной структуры рассуждений, предназначенной для проверки того, может ли структурное прайминг снизить глобальные несоответствия в больших языковых моделях. Проект, размещенный на платформе, исследует, улучшает ли двухэтапный процесс координацию всей системы по сравнению с локальной корректностью.

media Hugging Face Forums · 2 д назад · 7 просмотров

Левент Булут уточняет определение «смещения при суммаризации» и регистрирует фальсифицируемый протокол

Левент Булут обновил операционное определение «смещения при суммаризации», переведя его от расплывчатого описания к проверяемой конструкции, и зарегистрировал исследовательский протокол с заранее определёнными фальсификаторами. Новое определение характеризует это смещение как систематическую тенденцию моделей заменять структуру в режиме демонстрации (shown-mode) на абстрактные метки суммаризации (режим повествования/told mode), а не просто удалять детали.

media Hugging Face Forums · 2 д назад · 18 просмотров

Коррелированные ошибки в кворуме судей из похожих моделей, измеренные в этическом фильтре с отказом при сбое

Распределённый реестр с этическим фильтром, отказывающим при сбое, состоящий из дистиллированного классификатора на основе мешка слов, семантического ядра и панели небольших открытых моделей (qwen2.5:7b, llama3.2:3b, gemma2:2b), показывает, что судьи, обладающие общими чертами, демонстрируют коррелированные ошибки, а не независимые.

media Hugging Face Forums · 2 д назад · 15 просмотров

Предложение по системе декомпозиции пропозиций и противоречиво-управляемого рассуждения

Автор предлагает дизайн исследования для системы рассуждения, которая обнаруживает противоречия между двумя пропозициями путем их декомпозиции на более мелкие компоненты и поиска логических коллизий, вместо того чтобы полагаться на прямое суждение LLM.

media Hugging Face Forums · 2 д назад · 14 просмотров

Независимый исследователь просит рекомендацию от arXiv cs.CR для статьи о KavachBench

Независимый исследователь запрашивает рекомендацию от известных авторов в сообществе криптографии и безопасности для подачи статьи с названием «KavachBench: Эмпирическая оценка детерминированного обеспечения политики против инъекций на основе проблем в AI-агентах по написанию кода» на arXiv.

media Hugging Face Forums · 2 д назад · 18 просмотров

MB-Bidram делится экспериментальной архитектурой WideNDepth, разделяющей рассуждение и знания

MB-Bidram выпустила экспериментальную нейронную архитектуру под названием WideNDepth (WND), предназначенную для разделения способностей к рассуждению и хранения знаний. Модель состоит из «Wide части», которая функционирует как память, и «Depth части», которая действует как механизм рассуждения.

media Hugging Face Forums · 3 д назад · 16 просмотров

Исследователь ищет одного независимого аннотатора для разрешения неоднозначности согласия LLM

Исследователь просит одного независимого человеческого аннотатора разметить 100 турецких нарративных сцен, чтобы определить, обусловлено ли низкое межрейтерское согласие интерпретационной природой задачи или нечёткими определениями аннотации. Исследование показало, что четыре LLM и детектор на основе правил согласовывались друг с другом и человеческим эталоном примерно на уровне случайного угадывания, при этом значения κ Коэна варьировались от 0.000 до 0.185.

media Hugging Face Forums · 3 д назад · 16 просмотров

Предложение о прогрессивном росте моделей и открытом профиле оборудования для Трансформеров

Предложение на Hugging Face обсуждает две взаимосвязанные проблемы в ИИ: зависимость от обучения отдельных больших моделей и зависимость экосистемы от универсальных GPU.

media Hugging Face Forums · 3 д назад · 17 просмотров

GlucoEdge: прогнозирование тренда уровня глюкозы на устройстве с INT8-квантованием

Исследователь-фрилансер Мохамед Менаси опубликовал GlucoEdge — инженерное исследование, подробно описывающее конвейер машинного обучения для выполнения задач непосредственно на устройстве. Система предназначена для прогнозирования тренда уровня глюкозы по пяти классам с шагом 15 минут на основе данных непрерывного мониторинга глюкозы. В работе представлена компактная 1D CNN, содержащая всего 2909 параметров, и охвачен полный рабочий процесс от PyTorch до конвертации в LiteRT.

media Hugging Face Forums · 3 д назад · 18 просмотров

Предложение: прогрессивная передача знаний от Qwen 9B к 27B для фиксированной модели на 4B

Пользователь на форумах Hugging Face предлагает эксперимент по прогрессивной передаче знаний, в котором студентская модель фиксированного размера (Qwen 4B) последовательно обучается у всё более крупных моделей-учителей, а не напрямую у самой большой из доступных.

media Hugging Face Forums · 4 д назад · 32 просмотра

Обзор литературы показывает слабую корреляцию между экономией от сжатия и измеренным энергопотреблением

Независимый исследователь опубликовал обзор литературы, анализирующий, снижают ли методы сжатия моделей, такие как квантование, прунинг и дистилляция, фактически измеряемое энергопотребление или лишь уменьшают количество FLOPs.

media Hugging Face Forums · 4 д назад · 9 просмотров

Выпущена версия Celestium CARE для NVIDIA под видеокарты GTX/RTX

Версия Celestium CARE для NVIDIA завершена и доступна как профессиональный инструмент для видеокарт GTX и RTX. Она использует NVML для предоставления таких функций, как очистка VRAM, расписание автоматической очистки и полное мониторинг телеметрии.

media Hugging Face Forums · 4 д назад · 9 просмотров

Семантическая маршрутизация сокращает количество входных токенов Qwen2.5 на 41% и задержку на 45% в стресс-тесте с контекстом 14K

Стресс-тест GPU с замороженной 4-битной моделью Qwen2.5-7B-Instruct на вопросах моста HotpotQA демонстрирует, что осведомлённая о задаче семантическая маршрутизация значительно повышает эффективность и точность в условиях высоких дистракторов. Исследование сравнивало полный ограниченный контекст с запрос-осведомлённым семантическим селектором, сохраняющим 60% бюджета, выявив существенные улучшения скорости и точности.