Topik · Multimodal
lab Google DeepMind Blog · 2 hari lalu · 13 tayangan

Google DeepMind merilis model SL2T penerjemah bahasa isyarat ke teks untuk Gboard dan Live Transcribe

Google DeepMind dan Android telah memperkenalkan SL2T, sebuah model terjemahan bahasa isyarat ke teks (SL2T) yang sangat multibahasa yang membawa AI bahasa isyarat ke produk konsumen untuk pertama kalinya. Teknologi ini menggerakkan dikte dari isyarat ke teks di Gboard dan Live Transcribe pada Pixel 11, dimulai dengan American Sign Language (ASL) ke bahasa Inggris.

lab Google — The Keyword (AI) · 3 hari lalu · 40 tayangan

Google mendemonstrasikan kemampuan konsultasi video klinis waktu nyata dengan AMIE

Google Research dan Google DeepMind telah memajukan sistem AI medis penelitian mereka, AMIE, untuk mendemonstrasikan kemampuan konsultasi video klinis waktu nyata dalam sebuah studi pertama di jenisnya. Dibangun di atas Gemini dan Project Astra menggunakan arsitektur multi-agen, sistem ini menginterpretasikan isyarat visual dan auditori, memandu pemeriksaan fisik virtual, dan melakukan penalaran diagnostik secara waktu nyata.

lab Microsoft Research Blog · 3 hari lalu · 11 tayangan

Microsoft Research memperkenalkan CARE-X, VLM rontgen dada terpadu dengan supervisi tambahan dan pengukuran yang diperkaya alat

Microsoft Research telah memperkenalkan CARE-X, sebuah model penelitian yang dirancang untuk mengatasi kesenjangan dalam model bahasa-visi radiologi saat ini dengan menggabungkan penulisan laporan generatif dengan prediksi diagnostik yang terkali. Sistem ini menggunakan pembelajaran penguatan (DAPO) untuk memberi hadiah pada kebenaran klinis dan memadukan model Qwen3-VL-4B-Instruct dengan alat pengukuran deterministik untuk mengevaluasi kinerja pada kondisi yang memerlukan perhitungan presisi.

lab NVIDIA Research · 4 hari lalu

Hide to See memperkenalkan masking prefix penalaran untuk distilasi VLM

Peneliti mengusulkan kerangka kerja distilasi pikir-jawab baru yang meningkatkan kemampuan model bahasa-visi kompak untuk memanfaatkan bukti visual dengan melakukan masking pada prefix penalaran yang menonjol. Pendekatan ini mengatasi masalah "pelupakan visual" yang umum terjadi pada jejak pikir-jawab panjang, di mana siswa kehilangan fokus pada petunjuk visual selama penalaran yang diperpanjang.

lab NVIDIA Research · 18 hari lalu · 9 tayangan

NVIDIA memperkenalkan Spatial-IQ, kerangka kerja diagnostik hierarkis untuk penalaran spasial model multimodal

Peneliti di NVIDIA telah memperkenalkan Spatial-IQ, sebuah kerangka kerja diagnostik yang dirancang untuk mengurai kecerdasan spasial dari model bahasa besar multimodal (MLLM). Berbeda dengan benchmark yang ada yang memperlakukan model sebagai kotak hitam, pendekatan ini menguraikan penghitungan objek dalam struktur 3D bertumpuk menjadi sembilan sub-tugas perseptual dan kognitif yang selaras dengan tahap perkembangan manusia.

lab Google — The Keyword (AI) · 23 hari lalu · 1 tayangan

Google memperluas otomatisasi tugas Gemini Intelligence dan menghadirkan Notebook ke perangkat Galaxy

Pada Galaxy Unpacked 2026, Google mengumumkan tiga pembaruan untuk Samsung Galaxy Z Fold8 Ultra, Fold8, dan Flip8 yang baru, dengan fokus pada peluncuran Gemini Intelligence. Perusahaan ini memperluas kemampuan otomatisasi tugasnya untuk mendukung lebih dari 40 aplikasi populer dan memperkenalkan aplikasi Gemini Notebook secara langsung ke perangkat-perangkat tersebut.

lab Mistral AI News · 10 hari lalu · 4 tayangan

Shieldstral memperkenalkan pengklasifikasi keamanan multimodal 3B yang adaptif terhadap kebijakan

Shieldstral adalah pengklasifikasi keamanan multimodal open-weights 3B yang membingkai moderasi konten sebagai tugas penjawab pertanyaan yang adaptif terhadap kebijakan, sehingga memungkinkan penerimaan kebijakan dalam bahasa alami pada saat inferensi tanpa pelatihan ulang. Model ini menyatukan evaluasi keamanan teks dan gambar serta memberikan skor keamanan terkalibrasi di berbagai benchmark sambil berjalan secara efisien pada satu GPU NVIDIA 16GB.

arxiv arXiv cs.AI · 2 hari lalu · 3 tayangan

SCUT meningkatkan penalaran spasial pada VLM melalui CoT terstruktur dan RL proses-supervised

Para peneliti mengusulkan SCOUT, sebuah kerangka kerja yang meningkatkan penalaran spasial Model Bahasa-Gambar dengan menggabungkan Chain-of-Thought terstruktur dengan pembelajaran penguatan reward proses multi-tujuan. Pendekatan ini mengatasi masalah penugasan kredit pada metode RL yang ada dan mengintegrasikan persepsi kedalaman untuk pemahaman 3D yang komprehensif.

lab Hugging Face Blog · 2 hari lalu · 14 tayangan

Liquid AI merilis LFM2.5-VL-3B untuk kemampuan visi tepi yang lebih cepat

Liquid AI telah merilis LFM2.5-VL-3B, sebuah model visi-bahasa dengan 3 miliar parameter yang dirancang untuk memberikan kinerja yang lebih baik dan lebih cepat pada perangkat tepi. Model ini menggabungkan encoder visi SigLIP2 400M NaFlex dengan tulang punggung dari pendahulunya yang hanya teks, dilatih pada sekitar 34 triliun token termasuk empat kali lebih banyak data visi dibandingkan rilis sebelumnya.

lab Liquid AI · 2 hari lalu Berkeley Function-Calling Leaderboard · 32.5% · 15 tayangan

LFM2.5-VL-3B meningkatkan pemahaman layar dan pemanggilan fungsi untuk penyebaran di perangkat tepi

LFM2.5-VL-3B adalah model visi-bahasa baru yang memberikan kinerja kompetitif dibandingkan dengan model yang lebih besar sambil mempertahankan latensi rendah untuk aplikasi waktu nyata dan di perangkat. Model ini dibangun dari rilis LFM2-VL-3B sebelumnya dengan peningkatan signifikan dalam pemahaman layar, grounding, pemanggilan fungsi, dan kemampuan input multi-gambar.

arxiv arXiv cs.AI · 4 hari lalu

AMIE (Video) mencapai kinerja tingkat ahli dalam konsultasi medis real-time

Para peneliti telah mendemonstrasikan sistem AI tingkat ahli pertama untuk konsultasi video klinis real-time menggunakan AMIE (Video), sebuah sistem multi-agen berbasis Gemini yang mengintegrasikan dialog latensi rendah dengan persepsi audio-visual real-time. Dalam studi Pemeriksaan Klinis Terstruktur Objektif acak yang melibatkan 30 dokter perawatan primer dan 100 skenario, evaluator klinis menilai sistem setara atau lebih baik daripada dokter dalam pengambilan riwayat, diagnosis, manajemen, dan observasi fisik.