Пользователи хвалят GLM 5.2 за прямую и решительную позицию, в отличие от более сладких американских моделей. Автор предполагает, что такое поведение обусловлено культурно специфическими обучающими данными, что указывает на более сильное влияние локальных наборов данных, чем ранее предполагалось.
Позиция GLM 5.2 отражает влияние культурной подготовки
Односторонняя атака на GLM-5.3-Flash выявляет хрупкость безопасности в моделях MoE
Исследователи демонстрируют, что направленная абляция — атака с открытым исходным кодом, устраняющая отказ путем проецирования одного направления из весов, остается эффективной для передовых моделей смешанных экспертов (MoE), таких как GLM-5.3-Flash. Исследование показывает, что хотя атака выживает в архитектуре, ее эффекты распределяются по вниманию, плотным и маршрутизируемым экспертам, а не сосредоточены в одном месте.
ntrillard обнаружил крупнейшие координаты, не управляющие логит-стерованием Qwen2-1.5B
Причинное исследование логит-стерования по словарю на модели Qwen2-1.5B показывает, что самые крупные координаты в векторе стерования не обязательно отвечают за наблюдаемые поведенческие эффекты. Исследование, проведённое ntrillard, анализирует, как разреженное ранжированное логит-стерование влияет на генерацию токенов, и выявляет конкретные структурные компоненты, определяющие эти изменения.
WebWorld использует браузер как модель мира для самостоятельного улучшения веб-кода
Авторы представляют WebWorld, интерфейс, который позволяет Vision-Language Model (VLM) автономно взаимодействовать с браузером как с детерминированной моделью мира для веб-кода. Этот подход устраняет структурный недостаток самосовершенствования на основе VLM, при котором модель оценивает собственные исправления, вводя контрагента, которого невозможно обмануть.
Базовый трейс Gemma 4 показывает цикл галлюцинаций и самоотчет
Базовый трейс Gemma 4 с нулевым ограничением силы выявляет устойчивый цикл галлюцинаций, в котором модель генерирует самоотчет о неудаче перед тем, как войти в яму повторений. Телеметрия подтверждает, что «утечка» ролевых тегов и фразы вроде "STOPITSTOP" возникают в этом нестабильном состоянии, отражая паттерны, наблюдаемые в загрузчиках Llama и Gemma 3 с декабря 2025 года.
Исследование выявляет прогрессивную структурированность репрезентаций по глубине в 8 открытых моделях
Новый препринт анализирует динамику скрытых состояний в восьми локально проинструментированных небольших открытых трансформерных моделях, чтобы определить, следуют ли внутренние репрезентации структурированной прогрессии во время вывода. Исследование проводит различие между изменениями, происходящими по глубине модели, и теми, которые развиваются во времени авторегрессионной генерации.