Laboratorio · DeepSeek
lab DeepSeek API Docs · hace 14 d Codeforces (Elo) · 3471.0Elo · 55 vistas

DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo

DeepSeek ha lanzado oficialmente el modelo DeepSeek-V4.1-Flash, que sirve como el miembro más pequeño de su nueva familia de arquitecturas y cuenta con comprensión visual multimodal nativa. Esta nueva arquitectura está diseñada para proporcionar un techo de capacidad más alto, velocidades de inferencia más rápidas, mayor rendimiento y mejor potencial de escalado para modelos más grandes.

media MarkTechPost · hace 14 d · 52 vistas

DeepSeek lanza DeepSeek-V4.1-Flash con contexto de 1M y caché KV FP4

DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal Mixture-of-Experts que cuenta con una ventana de contexto de 1 millón de tokens y una caché KV FP4 que reduce la huella global de la caché a 890 bytes por token. El modelo utiliza una arquitectura de codificador-decodificador causal y Compressed Sparse Attention 2 (CSA2) para reducir significativamente los requisitos de memoria mientras mantiene el rendimiento.

arxiv arXiv cs.AI · hace 3 d · 19 vistas

CodeMidas escala entornos de aprendizaje por refuerzo para programación agéntica utilizando código fuente

Los investigadores presentan CodeMidas, una canalización agéntica que construye entornos de aprendizaje por refuerzo a partir de la funcionalidad implementada en repositorios de código abierto, utilizando el código fuente como única entrada. El método asigna cómputo agéntico para explorar la funcionalidad, construir pruebas basadas en la ejecución y validar tareas mediante repeticiones repetidas, lo que resulta en un conjunto de datos de 5.545 tareas de entrenamiento en 23 lenguajes de programación. Entrenar MiMo-V2.5 en estas tareas con GRPO mejora el rendimiento en cinco benchmarks diversos, incluyendo DeepSWE (+11,7%), ProgramBench (+17%) y Terminal-Bench v2.1 (+8,5%). El análisis de trayectorias indica que el agente entrenado con RL exhibe mejores comportamientos, como una mayor exploración del repositorio de código y una autoverificación más diversa. Estos resultados establecen el código fuente como una base escalable para construir entornos de RL que mejoran a los agentes de programación en diversas tareas de software.

arxiv arXiv cs.AI · hace 9 d · 26 vistas

Vista previa de Atria Dawn: modelo de lenguaje agénico fundamental para la investigación científica

Atria Dawn Preview es un modelo de lenguaje agénico fundamental diseñado para flujos de trabajo de investigación científica e ingeniería, entrenado mediante una Pipeline de Experiencia Verificable que conecta interacciones mediadas por herramientas con entornos ejecutables. En 16 benchmarks que abarcan investigación del mundo real, ingeniería y trabajo digital, el modelo es competitivo frente a agentes de vanguardia y alcanza la puntuación más alta reportada en cinco de ellos.