Laboratoire · DeepSeek
lab DeepSeek API Docs · il y a 21 j Codeforces (Elo) · 3471.0Elo · 68 vues

DeepSeek lance le modèle V4.1-Flash avec support multimodal natif

DeepSeek a officiellement lancé le modèle DeepSeek-V4.1-Flash, qui est le plus petit membre de sa nouvelle famille d'architectures et présente une compréhension visuelle multimodale native. Cette nouvelle architecture est conçue pour offrir un plafond de capacité plus élevé, des vitesses d'inférence plus rapides, un débit supérieur et un meilleur potentiel de mise à l'échelle pour les modèles plus grands.

media MarkTechPost · il y a 20 j · 55 vues

DeepSeek publie DeepSeek-V4.1-Flash avec un contexte de 1M et un cache KV FP4

DeepSeek AI a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal disposant d'une fenêtre de contexte de 1 million de tokens et d'un cache KV FP4 qui réduit l'empreinte globale du cache à 890 octets par token. Le modèle utilise une architecture encodeur-décodeur causal et Compressed Sparse Attention 2 (CSA2) pour réduire considérablement les besoins en mémoire tout en maintenant les performances.

arxiv arXiv cs.AI · il y a 10 j · 24 vues

CodeMidas met à l'échelle les environnements d'apprentissage par renforcement pour la programmation agentic en utilisant le code source

Les chercheurs présentent CodeMidas, un pipeline agentic qui construit des environnements d'apprentissage par renforcement à partir de la fonctionnalité implémentée dans des bases de code open-source, en utilisant le code source comme unique entrée. La méthode alloue du calcul agentic pour explorer la fonctionnalité, construire des tests ancrés sur l'exécution et valider les tâches via des rollouts répétés, aboutissant à un jeu de données de 5 545 tâches d'entraînement sur 23 langages de programmation. L'entraînement de MiMo-V2.5 sur ces tâches avec GRPO améliore les performances sur cinq benchmarks diversifiés, dont DeepSWE (+11,7%), ProgramBench (+17%) et Terminal-Bench v2.1 (+8,5%). L'analyse des trajectoires indique que l'agent entraîné par RL présente de meilleurs comportements, tels qu'une exploration accrue de la base de code et une auto-vérification plus diversifiée. Ces résultats établissent le code source comme une base évolutive pour construire des environnements RL qui améliorent les agents de codage dans diverses tâches logicielles.

arxiv arXiv cs.AI · il y a 15 j · 27 vues

Aperçu d'Atria Dawn : un modèle de langage agentique fondamental pour la recherche scientifique

Atria Dawn Preview est un modèle de langage agentique fondamental conçu pour les workflows de recherche scientifique et d'ingénierie, entraîné via un pipeline d'expérience vérifiable qui relie les interactions médiées par des outils à des environnements exécutables. Sur 16 benchmarks couvrant la recherche en monde réel, l'ingénierie et le travail numérique, le modèle est compétitif avec les agents de pointe et obtient le score le plus élevé signalé sur cinq d'entre eux.

media r/LocalLLaMA · il y a 21 j · 56 vues

DeepSeek publie V4.1 Flash, un modèle MoE de 552B à moindre coût et plus rapide

DeepSeek a officiellement publié le modèle DeepSeek V4.1 Flash, la version la plus légère de sa nouvelle série d'architectures dotée d'une compréhension visuelle multimodale native. Construit sur une conception Causal-Encoder-Decoder, il s'agit d'un modèle Mixture of Experts (MoE) de 552 milliards de paramètres qui n'active que 8 milliards de paramètres du côté entrée et 16 milliards du côté sortie.