Laboratório · DeepSeek
lab DeepSeek API Docs · há 22 d Codeforces (Elo) · 3471.0Elo · 73 visualizações

DeepSeek lança modelo V4.1-Flash com suporte multimodal nativo

A DeepSeek lançou oficialmente o modelo DeepSeek-V4.1-Flash, que serve como o menor membro de sua nova família de arquiteturas e apresenta compreensão visual multimodal nativa. Esta nova arquitetura é projetada para fornecer um teto de capacidade mais alto, velocidades de inferência mais rápidas, maior throughput e melhor potencial de escalabilidade para modelos maiores.

media MarkTechPost · há 21 d · 56 visualizações

DeepSeek lança DeepSeek-V4.1-Flash com contexto de 1M e cache KV FP4

A DeepSeek AI lançou o DeepSeek-V4.1-Flash, um modelo Mixture-of-Experts multimodal que possui uma janela de contexto de 1 milhão de tokens e um cache KV FP4 que reduz a pegada global do cache para 890 bytes por token. O modelo utiliza uma arquitetura de codificador-decodificador causal e Compressed Sparse Attention 2 (CSA2) para reduzir significativamente os requisitos de memória enquanto mantém o desempenho.

arxiv arXiv cs.AI · há 11 d · 24 visualizações

CodeMidas escala ambientes de RL para codificação agêntica usando código-fonte

Pesquisadores apresentam o CodeMidas, um pipeline agêntico que constrói ambientes de aprendizado por reforço a partir da funcionalidade implementada em repositórios de código aberto, utilizando o código-fonte como única entrada. O método aloca computação agêntica para explorar a funcionalidade, construir testes fundamentados na execução e validar tarefas por meio de repetidas rollouts, resultando em um conjunto de dados com 5.545 tarefas de treinamento em 23 linguagens de programação. Treinar o MiMo-V2.5 nessas tarefas com GRPO melhora o desempenho em cinco benchmarks diversos, incluindo DeepSWE (+11,7%), ProgramBench (+17%) e Terminal-Bench v2.1 (+8,5%). A análise de trajetórias indica que o agente treinado com RL exibe comportamentos melhores, como maior exploração da base de código e autoverificação mais diversa. Esses resultados estabelecem o código-fonte como uma base escalável para a construção de ambientes de RL que melhoram agentes de codificação em diversas tarefas de software.

arxiv arXiv cs.AI · há 16 d · 28 visualizações

Prévia do Atria Dawn: modelo de linguagem agêntico fundamental para pesquisa científica

O Atria Dawn Preview é um modelo de linguagem agêntico fundamental projetado para fluxos de trabalho de pesquisa científica e engenharia, treinado por meio de um Pipeline de Experiência Verificável que conecta interações mediadas por ferramentas a ambientes executáveis. Em 16 benchmarks que abrangem pesquisa do mundo real, engenharia e trabalho digital, o modelo é competitivo em relação aos agentes de ponta e alcança a maior pontuação relatada em cinco deles.