Lab · DeepSeek
lab DeepSeek API Docs · 21 hari lalu Codeforces (Elo) · 3471.0Elo · 68 tayangan

DeepSeek merilis model V4.1-Flash dengan dukungan multimodal asli

DeepSeek telah secara resmi merilis model DeepSeek-V4.1-Flash, yang merupakan anggota terkecil dari keluarga arsitektur barunya dan memiliki pemahaman visual multimodal asli. Arsitektur baru ini dirancang untuk memberikan batas kemampuan yang lebih tinggi, kecepatan inferensi yang lebih cepat, throughput yang lebih tinggi, dan potensi skalabilitas yang lebih baik untuk model yang lebih besar.

media MarkTechPost · 20 hari lalu · 55 tayangan

DeepSeek merilis DeepSeek-V4.1-Flash dengan konteks 1M dan cache KV FP4

DeepSeek AI telah merilis DeepSeek-V4.1-Flash, sebuah model Mixture-of-Experts multimodal yang dilengkapi jendela konteks 1 juta token dan cache KV FP4 yang mengurangi jejak cache global menjadi 890 byte per token. Model ini memanfaatkan arsitektur encoder-decoder kausal dan Compressed Sparse Attention 2 (CSA2) untuk secara signifikan menurunkan kebutuhan memori sambil mempertahankan kinerja.

arxiv arXiv cs.AI · 10 hari lalu · 24 tayangan

CodeMidas menskalakan lingkungan RL pemrograman agentic menggunakan kode sumber

Peneliti memperkenalkan CodeMidas, sebuah pipeline agentic yang membangun lingkungan pembelajaran penguatan dari fungsionalitas yang diimplementasikan dalam basis kode open-source, dengan menggunakan kode sumber sebagai satu-satunya input. Metode ini mengalokasikan komputasi agentic untuk mengeksplorasi fungsionalitas, membangun tes berbasis eksekusi, dan memvalidasi tugas melalui rollouts berulang, menghasilkan dataset berisi 5.545 tugas pelatihan di 23 bahasa pemrograman. Pelatihan MiMo-V2.5 pada tugas-tugas ini dengan GRPO meningkatkan kinerja pada lima benchmark beragam, termasuk DeepSWE (+11,7%), ProgramBench (+17%), dan Terminal-Bench v2.1 (+8,5%). Analisis trajektori menunjukkan bahwa agen yang dilatih dengan RL menampilkan perilaku yang lebih baik seperti eksplorasi basis kode yang lebih besar dan verifikasi diri yang lebih beragam. Hasil-hasil ini menetapkan kode sumber sebagai fondasi yang dapat diskalakan untuk membangun lingkungan RL yang meningkatkan agen pemrograman di berbagai tugas perangkat lunak.

arxiv arXiv cs.AI · 15 hari lalu · 27 tayangan

Pratinjau Atria Dawn: model bahasa agentic dasar untuk penelitian ilmiah

Atria Dawn Preview adalah model bahasa agentic dasar yang dirancang untuk alur kerja penelitian ilmiah dan teknik, dilatih melalui Pipelina Pengalaman Terverifikasi yang menghubungkan interaksi yang dimediasi alat ke lingkungan yang dapat dieksekusi. Di seluruh 16 benchmark yang mencakup penelitian dunia nyata, teknik, dan pekerjaan digital, model ini kompetitif dengan agen terdepan dan mencapai skor tertinggi yang dilaporkan pada lima di antaranya.