Safety & alignment — korshunov.ai

Safety & alignment Страница 11 / 11

Каузальный подход к аудиту раскрытий синтетических данных

Модель-независимый подход к аудиту обнаруживает и различает настоящие и фантомные раскрытия в синтетических данных. Он использует только синтетические выводы и контрольную выборку, чтобы проводить статистические проверки, обеспечивая более строгие границы утечки конфиденциальности, чем ранее известные методы, без необходимости доступа к модели или дополнительного обучения.

arxiv arXiv cs.LG · 9 д назад

Нейронная модель взаимодействия экспозиции для интерпретируемого эффекта лечения

NEXIS определяет причинные гетерогенные эффекты лечения за счёт обнаружения марковских пустот в данных до начала лечения. Он использует многомодальные и многоканальные измерения и масштабируемые представления с минимальным вмешательством человека, обеспечивая интерпретируемую и действенную аналитику на основе контролируемых экспериментов.

arxiv arXiv cs.LG · 9 д назад

Атака RING: использование дифференциальной конфиденциальности в распределённом обучении для скрытия сигналов бэкдора

Новая атака RING использует дифференциальную конфиденциальность в распределённом обучении для скрытия сигналов бэкдора при максимизации их воздействия. Она достигает 90,3% успешности атаки против передовых защит, что на 26,08 раз превышает базовые методы, и выявляет критическую уязвимость в DP-FL из-за встроенной маскировки вредоносных обновлений.

media r/LocalLLaMA · 10 д назад

HalBench проверяет 29 открытых моделей на сикофантизм и халлюцинации

HalBench оценивает 29 открытых моделей языковых моделей на специальном бенчмарке для сикофантизма и халлюцинаций. Qwen 3.6 и Gemma 4 превосходят более крупные модели, при этом Qwen 3.6 достигает 36,6% отклонения — выше, чем у GPT-5.4 и Gemini 3.1 Pro. Размер модели не коррелирует с честными ответами, что указывает на то, что архитектура и обучающие данные важнее, чем количество параметров.

blog Simon Willison · 10 д назад

Cloudflare CAPTCHA активируется только для запросов с амперсандом

Симон Виллисон настроил CAPTCHA от Cloudflare так, чтобы он активировался только для запросов поиска, содержащих хотя бы один амперсанд. Правило использует пользовательский фильтр: (http.request.uri.path wildcard r"\/search\/*" и http.request.uri.query contains "&"). Это позволяет простым запросам, таким как /search/?q=lemur, проходить без CAPTCHA.