Multimodal
media MarkTechPost · 4 hari lalu · 1 tayangan

NVIDIA merilis Alpamayo 2 Super, model VLA terbuka 34B untuk pengemudi otonom

NVIDIA telah merilis Alpamayo 2 Super, model visi-bahasa-aksi (VLA) dengan 34 miliar parameter yang dirancang untuk robotaxi dan pengemudi otonom di bawah lisensi OpenMDW-1.1. Model ini menargetkan peristiwa ekor panjang dengan menggabungkan tulang punggung Cosmos 3 Super Reasoner berukuran 32B dengan decoder aksi berbasis difusi berukuran 2,3B untuk menghasilkan lintasan, penjelasan kausal, dan meta-aksi dari video multi-kamera.

arxiv arXiv cs.AI · 4 hari lalu

Video-DeepResearch memperkenalkan agen multimodal untuk aliran video berkelanjutan

Para peneliti memperkenalkan Video-DeepResearch (Video-DR), sebuah kerangka kerja yang memperluas agen multimodal dari gambar statis ke aliran video berkelanjutan, dengan mengatasi bias modalitas dan kebocoran pengetahuan parametrik. Sistem ini menggunakan pipa persepsi-penjelajahan yang terdekoupling dengan pembukaan alat bertahap untuk memaksakan penjangkaran visual lintas frame sebelum pengambilan web.

lab Mistral AI News · 5 hari lalu · 3 tayangan

Shieldstral memperkenalkan pengklasifikasi keamanan multimodal 3B yang adaptif terhadap kebijakan

Shieldstral adalah pengklasifikasi keamanan multimodal open-weights 3B yang membingkai moderasi konten sebagai tugas penjawab pertanyaan yang adaptif terhadap kebijakan, sehingga memungkinkan penerimaan kebijakan dalam bahasa alami pada saat inferensi tanpa pelatihan ulang. Model ini menyatukan evaluasi keamanan teks dan gambar serta memberikan skor keamanan terkalibrasi di berbagai benchmark sambil berjalan secara efisien pada satu GPU NVIDIA 16GB.

media MarkTechPost · 6 hari lalu GPQA Diamond · 89.5% · 1 tayangan

Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B

Thinking Machines Lab telah merilis Inkling-Small, sebuah model Mixture-of-Experts dengan bobot terbuka yang memiliki total 276 miliar parameter dan 12 miliar parameter aktif. Model ini dilatih untuk bernalar secara native pada teks, gambar, dan audio, serta dilengkapi jendela konteks 1M token dan upaya berpikir yang dapat disesuaikan.

media r/LocalLLaMA · 12 hari lalu · 5 tayangan

Microsoft merilis Mage-VL, model multimodal streaming asli codec

Microsoft telah merilis Mage-VL, model dasar multimodal 4B-parameter yang efisien untuk pemahaman gambar dan video yang menggunakan pendekatan asli codec untuk menyederhanakan pemrosesan visual. Sistem ini memisahkan aliran video menjadi frame jangkar (I) dan frame prediksi (P), hanya mempertahankan patch di mana codec mengalokasikan bit untuk mengurangi konsumsi token visual lebih dari 75%.

lab NVIDIA Research · 12 hari lalu · 8 tayangan

NVIDIA memperkenalkan Spatial-IQ, kerangka kerja diagnostik hierarkis untuk penalaran spasial model multimodal

Peneliti di NVIDIA telah memperkenalkan Spatial-IQ, sebuah kerangka kerja diagnostik yang dirancang untuk mengurai kecerdasan spasial dari model bahasa besar multimodal (MLLM). Berbeda dengan benchmark yang ada yang memperlakukan model sebagai kotak hitam, pendekatan ini menguraikan penghitungan objek dalam struktur 3D bertumpuk menjadi sembilan sub-tugas perseptual dan kognitif yang selaras dengan tahap perkembangan manusia.

arxiv arXiv cs.AI · 12 hari lalu · 1 tayangan

ClinFusion memperkenalkan MLLM berpusat visi untuk pemahaman medis holistik

Para peneliti memperkenalkan ClinFusion, model bahasa besar multimodal berpusat visi yang dirancang untuk mengatasi tantangan penerapan AI dalam praktik klinis dengan menyatukan pemahaman gambar medis 2D dan 3D. Sistem ini memiliki pengkode visi kaskade komposisional dengan operator Fusi Lokalitas Berpenuh Spasial Kaskade dan mencakup kerangka evaluasi baru yang terdiri dari MedIF-Bench serta metrik berbasis wilayah minat.

media MarkTechPost · 14 hari lalu · 2 tayangan

Induction Labs merilis Photon-1, model imajinasi yang dilatih pada 18 tahun video

Induction Labs telah merilis Photon-1, sebuah transformer campuran ahli (mixture-of-experts) sparse 106B-A5B yang belajar mensimulasikan lingkungan desktop dan bermain game dengan memprediksi frame masa depan dari video mentah tanpa label aksi. Model ini menggunakan kuantisasi skalar hingga untuk mengompresi setiap frame menjadi 960 token diskrit, mencapai kompresi lebih dari 100 kali lebih baik daripada representasi yang ada sambil mempertahankan detail teks dan tata letak.