Лаборатория · Cognition
github CrewAI · 3 д назад · 7 просмотров

crewAI 1.15.12 добавляет URLReadTool и унифицирует создание структуры проекта

Команда crewAI выпустила версию 1.15.12, внедрив новые возможности для использования инструментов и инициализации проектов. Это обновление включает новый инструмент для чтения произвольных URL-адресов и объединяет процесс создания структуры проекта под единой командой CLI.

lab Mistral AI News · 5 д назад · 3 просмотра

Shieldstral представляет адаптивный к политике 3B мультимодальный классификатор безопасности

Shieldstral — это 3B модель с открытыми весами, являющаяся мультимодальным классификатором безопасности, которая рассматривает модерацию контента как задачу ответа на вопросы, адаптируемую к политике, что позволяет ей принимать политики на естественном языке во время вывода без переобучения. Она объединяет оценку безопасности текста и изображений и предоставляет калиброванные оценки безопасности по различным бенчмаркам, эффективно работая на одном GPU NVIDIA с 16 ГБ памяти.

media r/LocalLLaMA · 17 д назад

Cactus дообучает Gemma 4 E2B с помощью зонда для вывода оценок уверенности

Cactus провела постобучение модели Gemma 4 E2B для генерации оценки уверенности в диапазоне от 0 до 1 для каждого ответа, что позволяет разработчикам перенаправлять неопределённые запросы на более мощные облачные модели. Команда достигла этого, добавив лёгкий слой зонда из 68 тысяч параметров, который считывает промежуточные скрытые состояния во время декодирования для прогнозирования вероятности ошибки.

arxiv arXiv cs.LG · 25 д назад

TerraZero: процедурный симулятор вождения обеспечивает масштабное обучение с нуля без демонстраций

Исследователи представляют TerraZero, процедурный симулятор вождения и стек обучения методом self-play, предназначенный для обучения надежных агентов автономного вождения без человеческих демонстраций. Система использует настраиваемый движок C для выполнения симуляции на CPU и вывода политик на GPU по пути с нулевым копированием, обеспечивая 1,3 млн шагов агента в секунду на одном серверном GPU.

arxiv arXiv cs.AI · 27 д назад

ProofCouncil: агент LLM для решения открытых математических задач

Исследователи представляют ProofCouncil, агента на базе LLM, предназначенного для решения открытых математических проблем с использованием архитектуры автор-критик. Система была представлена как участие во втором наборе FirstProof — конкурсе, включающем 10 реальных математических задач, которые агенты должны решать автономно.

arxiv arXiv cs.CL · 27 д назад AIME 2025 · 92.7% · 2 просмотра

Mach-Mind-4-Flash: 35B MoE агентная модель достигает уровня более крупных моделей благодаря оптимизации после обучения

Технический отчет Mach-Mind-4-Flash представляет собой агентную модель Mixture-of-Experts (MoE) с 35 млрд параметров, в которой активируется только 3 млрд параметров. Достигнуто за счет оптимизации после обучения без увеличения вычислений при предварительном обучении; производительность сопоставима или превосходит модели класса 100 млрд параметров.