Video generation
media MarkTechPost · 8 hari lalu · 15 tayangan

MiniMax merilis MiniMax H3, model video omni-modal yang menghasilkan klip 2K dengan audio stereo asli

MiniMax telah merilis MiniMax H3, model generasi multimodal tujuan umum yang menyatukan teks, gambar, video, dan audio ke dalam satu konteks untuk menghasilkan klip video 2K hingga durasi 15 detik dengan suara stereo asli. Berbeda dengan tumpukan sebelumnya yang mengandalkan model ahli terpisah untuk tugas tertentu, H3 memungkinkan pengguna mengekspresikan hubungan referensi dan pengeditan melalui prompt bahasa alami.

lab Hugging Face Blog · 13 hari lalu · 19 tayangan

NVIDIA memperkenalkan Cosmos-H-Dreams, simulator generatif waktu nyata untuk robotika bedah

NVIDIA telah memperkenalkan Cosmos-H-Dreams, simulator generatif berbasis aksi dan waktu nyata untuk robotika bedah yang memadatkan kemampuan Cosmos-H-Surgical-Simulator-nya ke dalam model siswa kausal. Dilayani melalui perpustakaan inferensi streaming dipercepat FlashDreams dari NVIDIA, sistem ini memungkinkan kontrol interaktif oleh manusia atau kebijakan terlatih dalam loop tertutup.

lab Hugging Face Blog · 23 hari lalu · 5 tayangan

NVIDIA NeMo Automodel memungkinkan penalaan halus model difusi terdistribusi dengan Hugging Face Diffusers

NVIDIA dan Hugging Face telah mengintegrasikan NVIDIA NeMo Automodel dengan pustaka 🤗 Diffusers untuk menyediakan pelatihan terdistribusi tingkat produksi untuk model difusi sumber terbuka. Kolaborasi ini memungkinkan pengguna menala halus model format Diffusers apa pun di Hugging Face Hub tanpa memerlukan konversi checkpoint atau penulisan ulang kode model.

lab Google — The Keyword (AI) · 23 hari lalu · 6 tayangan

Google menambahkan Gemini Omni dan avatar pribadi ke Google Vids

Google telah meluncurkan dua pembaruan baru untuk Google Vids: integrasi Gemini Omni untuk pembuatan dan pengeditan video berbasis teks, serta fitur yang memungkinkan pengguna membuat avatar digital pribadi. Alat-alat ini bertujuan menyederhanakan pembuatan video dengan memungkinkan pengguna menghasilkan klip dari prompt bahasa alami dan referensi gambar, serta tampil dalam video tanpa rekaman fisik.

arxiv arXiv cs.CL · 24 hari lalu

Text2Sign: Baseline difusi GPU tunggal untuk generasi video bahasa isyarat dari teks

Para peneliti menyajikan Text2Sign, model difusi yang dikondisikan oleh teks dan dirancang untuk menghasilkan klip bahasa isyarat pendek pada satu GPU NVIDIA L4, mengatasi biaya tinggi yang terkait dengan pelatihan dan evaluasi model difusi video. Sistem ini menggabungkan pengode teks visi-bahasa yang dibekukan dengan pengode-pengurai 3D serta perhatian spasiotemporal terfaktorisasi untuk mengurangi kebutuhan komputasi sambil mempertahankan koherensi gerakan.