Topik · Video generation
lab NVIDIA Research · 16 hari lalu · 20 tayangan

FastGen-PDD memperkenalkan distilasi dekoding paralel untuk generasi video dan gambar yang cepat

Para peneliti memperkenalkan Distilasi Dekoding Paralel (PDD), metode berbasis lintasan yang disederhanakan untuk mempercepat inferensi pada model pencocokan aliran dan difusi. Berbeda dengan pendekatan saat ini yang mengandalkan distilasi skor variasional yang sulit dioptimalkan dan kerugian adversarial, PDD memprediksi beberapa langkah denoising per evaluasi jaringan.

media MarkTechPost · 6 jam lalu

Peneliti NVIDIA merilis Physis-Lang untuk meningkatkan penalaran fisika pada model video Cosmos 3

Peneliti dari NVIDIA, MIT, dan Universitas Oxford telah memperkenalkan Physis-Lang, sebuah kerangka kerja yang meningkatkan model dunia video dengan mengintegrasikan bahasa fisik yang berevolusi secara mandiri ke dalam caption. Pendekatan ini memperlakukan bahasa fisik sebagai representasi yang dapat dioptimalkan untuk kurasi data, pelatihan model, dan inferensi guna memperbaiki kesalahan fisika pada video yang dihasilkan.

media MarkTechPost · 3 hari lalu · 11 tayangan

Google Research memperkenalkan 4 kerangka kerja agentic untuk generasi video koheren sepanjang menit

Google Research telah memperkenalkan co-director video AI yang terdiri dari empat kerangka kerja agentic yang dirancang untuk menghasilkan video koheren sepanjang menit dengan mengatasi drift identitas dan kesalahan berantai yang umum terjadi dalam pipa multi-shot. Sistem ini beroperasi sebagai lapisan orkestrasi model-agnostik di atas Gemini dan Veo, memanfaatkan watermarking SynthID untuk output.

media Latent Space · 6 hari lalu · 11 tayangan

Runway memperkenalkan WorldPrompt untuk generasi dunia interaktif secara waktu nyata

Runway telah memperkenalkan GWM Worlds 2, sebuah pratinjau penelitian yang mengubah generasi video dan audio berketepatan tinggi menjadi simulasi interaktif waktu nyata menggunakan model difusi autoregresif. Rilis ini menampilkan WorldPrompt, format input baru yang memungkinkan pengguna menentukan dunia dan aksi yang dihasilkan dengan memperbaiki aspek lingkungan serta membuat peristiwa berbasis timestamp.

arxiv arXiv cs.AI · 8 hari lalu · 17 tayangan

VideoX-Qwen memperkenalkan kerangka kerja berpusat pada data untuk pengeditan video berbasis instruksi

Peneliti mempersembahkan VideoX-Qwen, sebuah kerangka kerja terintegrasi yang menggabungkan konstruksi data yang dapat diskalakan dengan pelatihan model untuk memajukan pengeditan video tujuan umum yang digerakkan oleh instruksi. Sistem ini memanfaatkan pipeline produksi yang mengorganisir model khusus untuk menghasilkan catatan pengeditan arah, menghasilkan lebih dari 1,2 juta sampel berkualitas tinggi dalam tugas penambahan, penghapusan, penggantian, dan atribut.