Multimodal
lab Tencent Hunyuan (HF) · 6 hari lalu · 64 tayangan

Tencent merilis WeVisDoc-4B, parser dokumen end-to-end

Tencent telah merilis WeVisDoc-4B, sebuah parser dokumen end-to-end untuk gambar halaman yang mengonversi halaman menjadi Markdown terstruktur dengan rumus LaTeX dan tabel HTML. Difo-tune dari Qwen3-VL-4B-Instruct, model ini mencapai skor keseluruhan 95.38 di OmniDocBench v1.6 dan berada di peringkat pertama di antara parser yang dibandingkan dalam semua empat pengaturan yang dilaporkan.

lab IBM Research (Granite) · 13 hari lalu · 24 tayangan

IBM dan NASA membuka model dasar bulan NASA-IBM Lunar Foundation Model sebagai open source

IBM dan NASA telah membuka model dasar bulan NASA-IBM Lunar Foundation Model sebagai open source, sebuah sistem AI yang mengonsolidasikan puluhan tahun data bulan multimodal dari misi AS dan Jepang menjadi satu representasi. Dibangun di atas arsitektur TerraMind milik IBM, model ini mengintegrasikan pengamatan pada berbagai skala dan sudut pandang untuk mengatasi tantangan seperti pencahayaan kompleks dan resolusi data.

lab DeepSeek API Docs · 13 hari lalu Codeforces (Elo) · 3471.0Elo · 51 tayangan

DeepSeek merilis model V4.1-Flash dengan dukungan multimodal asli

DeepSeek telah secara resmi merilis model DeepSeek-V4.1-Flash, yang merupakan anggota terkecil dari keluarga arsitektur barunya dan memiliki pemahaman visual multimodal asli. Arsitektur baru ini dirancang untuk memberikan batas kemampuan yang lebih tinggi, kecepatan inferensi yang lebih cepat, throughput yang lebih tinggi, dan potensi skalabilitas yang lebih baik untuk model yang lebih besar.

media MarkTechPost · 18 hari lalu · 33 tayangan

Google meluncurkan pemahaman video agentic untuk model Gemini Flash

Google telah meluncurkan pemahaman video agentic di seluruh model Gemini Flash-nya, menggantikan metode pemrosesan statis sebelumnya dengan sistem yang menavigasi garis waktu video sesuai permintaan. Perubahan ini memungkinkan model memutuskan apa yang akan ditonton, pada frame rate berapa, dan melalui modalitas mana, alih-alih mengimpor seluruh garis waktu pada satu frame per detik secara tetap.

lab Hugging Face Blog · 20 hari lalu · 34 tayangan

NeoMME merilis encoder multimodal efisien dengan retrieval dense dan late-interaction

Para peneliti memperkenalkan NeoMME, sebuah keluarga encoder multimodal multilingual berukuran 260M dan 800M yang memproses teks dan patch gambar mentah menggunakan satu Transformer bidirectional. Berbeda dengan model bahasa visual generatif, NeoMME tidak bergantung pada menara visi pretrained terpisah atau decoder kausal, melainkan melatih seluruh model dari awal dengan tujuan discrete-diffusion termaskir.