Лаборатория · DeepSeek
lab DeepSeek API Docs · 13 д назад Codeforces (Elo) · 3471.0Elo · 51 просмотр

DeepSeek выпустила модель V4.1-Flash с нативной мультимодальной поддержкой

DeepSeek официально выпустила модель DeepSeek-V4.1-Flash, которая является самым маленьким представителем нового семейства архитектур и обладает нативным мультимодальным визуальным пониманием. Эта новая архитектура предназначена для обеспечения более высокого предела возможностей, более быстрых скоростей вывода, большей пропускной способности и лучшего потенциала масштабирования для больших моделей.

media AI News (smol.ai) · 10 д назад · 38 просмотров

DeepSeek выпустила V4.1-Flash — модель с открытыми весами, ориентированную на экстремальную эффективность вывода

DeepSeek выпустила V4.1-Flash, новую флагманскую модель с открытыми весами, предназначенную для экстремальной эффективности вывода и низкой стоимости. Модель использует причинную архитектуру энкодер-декодер для значительного снижения активных вычислений и затрат на KV/кэш.

media Latent Space · 11 д назад · 27 просмотров

DeepSeek выпустила v4.1-Flash с архитектурой 763B-P8B-D16B для эффективного вывода

DeepSeek запустила DeepSeek v4.1-Flash, новую флагманскую модель с открытыми весами, использующую новую причинную архитектуру кодировщика-декодатора, разработанную для максимизации эффективности вывода и снижения затрат.

media MarkTechPost · 13 д назад · 51 просмотр

DeepSeek выпустила DeepSeek-V4.1-Flash с контекстом 1M и FP4 KV-кэшем

Компания DeepSeek AI выпустила модель DeepSeek-V4.1-Flash, мультимодальную Mixture-of-Experts модель с контекстным окном на 1 миллион токенов и FP4 KV-кэшем, который сокращает глобальный размер кэша до 890 байт на токен. Модель использует причинно-следующую архитектуру кодировщика-декодировщика и Compressed Sparse Attention 2 (CSA2) для значительного снижения требований к памяти при сохранении производительности.

media r/LocalLLaMA · 5 ч назад · 9 просмотров

Глубокий поиск и Moonshot AI сталкиваются с расследованием в Пекине из-за потенциальных утечек данных в Anthropic

Китайские регуляторы проводят расследование в отношении DeepSeek и Moonshot AI по поводу потенциальных утечек данных американской компании Anthropic. Это расследование следует за слухами о руководителях Kimi, хотя ситуация в настоящее время описывается как расследование, а не подтвержденные аресты.

arxiv arXiv cs.AI · 2 д назад · 18 просмотров

CodeMidas масштабирует агентные среды обучения с подкреплением для программирования на основе исходного кода

Исследователи представляют CodeMidas, агентный конвейер, который создает среды обучения с подкреплением из реализованной функциональности в репозиториях открытого исходного кода, используя исходный код в качестве единственного входа. Метод распределяет агентные вычислительные ресурсы для исследования функциональности, создания тестов, основанных на исполнении, и валидации задач через повторяющиеся проходы, что приводит к формированию набора данных из 5 545 обучающих задач по 23 языкам программирования. Обучение MiMo-V2.5 на этих задачах с использованием GRPO улучшает показатели на пяти разнообразных бенчмарках, включая DeepSWE (+11,7%), ProgramBench (+17%) и Terminal-Bench v2.1 (+8,5%). Анализ траекторий показывает, что агент, обученный методом RL, демонстрирует лучшее поведение, такое как более активное исследование кодовой базы и более разнообразная самопроверка. Эти результаты устанавливают исходный код в качестве масштабируемой основы для создания сред RL, улучшающих работу агентов программирования при решении различных задач в области программного обеспечения.

arxiv arXiv cs.AI · 8 д назад · 24 просмотра

Предварительная версия Atria Dawn: базовая агентная языковая модель для научных исследований

Предварительная версия Atria Dawn представляет собой базовую агентную языковую модель, предназначенную для научных исследований и инженерных рабочих процессов, обученную с помощью конвейера проверяемого опыта, который связывает опосредованные инструментами взаимодействия с исполняемыми средами. По 16 бенчмаркам, охватывающим реальные исследования, инженерию и цифровую работу, модель конкурентоспособна с передовыми агентами и достигает наивысшего зафиксированного результата в пяти из них.

media r/LocalLLaMA · 11 д назад · 22 просмотра

Пользовательский код ускоряет работу DeepSeek V4.1 на GPU A100 быстрее официального API

Пользователь разработал собственную реализацию, позволяющую запускать модель DeepSeek V4.1 на графических процессорах NVIDIA A100 с производительностью, превышающей показатели официального API.

media r/LocalLLaMA · 13 д назад · 44 просмотра

DeepSeek выпустила V4.1 Flash — модель MoE на 552B с меньшей стоимостью и высокой скоростью

Компания DeepSeek официально представила модель DeepSeek V4.1 Flash, самую компактную в новой серии архитектур с нативным мультимодальным визуальным пониманием. Построенная на основе архитектуры Causal-Encoder-Decoder, она представляет собой модель Mixture of Experts (MoE) на 552B параметров, активируя только 8B параметров на стороне ввода и 16B — на стороне вывода.