Topik · Inference efficiency
lab Microsoft Research Blog · 7 hari lalu · 28 tayangan

Microsoft Research menunjukkan bahwa pengalihan beban inferensi AI fisik meningkatkan kinerja robot dan masa pakai baterai

Microsoft Research menantang asumsi bahwa inferensi AI fisik harus berjalan secara eksklusif pada GPU onboard robot, dengan mendemonstrasikan bahwa pengalihan ke infrastruktur tepi atau cloud secara signifikan meningkatkan beban kerja manipulasi mobile. Studi sistematis mereka terhadap beban kerja robotika mengungkapkan bahwa mengandalkan komputasi onboard membatasi kinerja, masa pakai baterai, dan skalabilitas.

lab OpenAI News · 8 hari lalu · 24 tayangan

Mengurangi waktu dan biaya penelitian menjadi setengah dengan GPT-6 Astra

Parallel telah mengintegrasikan GPT-6 Astra dari OpenAI ke dalam infrastruktur agen AI-nya, mencapai pengurangan 50% baik dalam waktu penelitian maupun biaya kode dibandingkan dengan model sebelumnya. Perusahaan melaporkan bahwa model baru memungkinkan agen menyelesaikan pekerjaan pengetahuan kompleks secara signifikan lebih cepat sambil mempertahankan output berkualitas tinggi.

lab NVIDIA Research · 16 hari lalu · 20 tayangan

FastGen-PDD memperkenalkan distilasi dekoding paralel untuk generasi video dan gambar yang cepat

Para peneliti memperkenalkan Distilasi Dekoding Paralel (PDD), metode berbasis lintasan yang disederhanakan untuk mempercepat inferensi pada model pencocokan aliran dan difusi. Berbeda dengan pendekatan saat ini yang mengandalkan distilasi skor variasional yang sulit dioptimalkan dan kerugian adversarial, PDD memprediksi beberapa langkah denoising per evaluasi jaringan.

lab NVIDIA Research · 19 hari lalu · 28 tayangan

NVIDIA merilis GPIR untuk pengambilan informasi pribadi yang dipercepat GPU

Peneliti dari NVIDIA telah memperkenalkan GPIR, sebuah sistem yang mempercepat Private Information Retrieval (PIR) pada GPU dengan mengatasi komputasi sisi server dan lalu lintas memori tinggi yang melekat pada protokol berbasis kisi. Sistem ini menggunakan model eksekusi hibrida sadar tahap yang secara dinamis beralih antara kernel tingkat operasi dan tingkat tahap untuk memaksimalkan penggunaan kembali data di dalam chip.

lab OpenAI News · 19 hari lalu · 37 tayangan

OpenAI meningkatkan layanan penyimpanan Habitat hingga 70 juta permintaan per detik

OpenAI telah meningkatkan platform penyimpanan online internalnya, Habitat, untuk menangani lebih dari 70 juta permintaan per detik bagi lebih dari satu miliar pengguna ChatGPT mingguan di hampir 40 wilayah geografis. Sistem ini kini melayani lebih dari 500 petabyte data, berevolusi dari pustaka sisi klien Python sederhana menjadi layanan terdistribusi yang kompleks.

media MarkTechPost · 20 hari lalu · 55 tayangan

DeepSeek merilis DeepSeek-V4.1-Flash dengan konteks 1M dan cache KV FP4

DeepSeek AI telah merilis DeepSeek-V4.1-Flash, sebuah model Mixture-of-Experts multimodal yang dilengkapi jendela konteks 1 juta token dan cache KV FP4 yang mengurangi jejak cache global menjadi 890 byte per token. Model ini memanfaatkan arsitektur encoder-decoder kausal dan Compressed Sparse Attention 2 (CSA2) untuk secara signifikan menurunkan kebutuhan memori sambil mempertahankan kinerja.

arxiv arXiv cs.CL · 16 jam lalu · 1 tayangan

Model Bahasa Konteks mengelola konteks secara asli sebagai file yang dapat diedit

Peneliti memperkenalkan Model Bahasa Konteks (CLM), sebuah arsitektur baru yang memperlakukan jendela konteks model sebagai file yang dapat diedit, memungkinkan model melakukan pembaruan tanpa batas pada memorinya sendiri. Pendekatan ini menggeser manajemen konteks dari kendali harness eksternal ke perilaku model intrinsik, memungkinkan pembelajaran strategi manajemen konteks baik dalam-konteks maupun parametrik.