Google Research telah memperkenalkan co-director video AI yang terdiri dari empat kerangka kerja agentic yang dirancang untuk menghasilkan video koheren sepanjang menit dengan mengatasi drift identitas dan kesalahan berantai yang umum terjadi dalam pipa multi-shot. Sistem ini beroperasi sebagai lapisan orkestrasi model-agnostik di atas Gemini dan Veo, memanfaatkan watermarking SynthID untuk output.
Suite ini mencakup Co-Director, yang menggunakan pencarian bandit multi-lengan untuk perencanaan kreatif; CANVAS, yang menyediakan memori visual persisten untuk menjaga konsistensi karakter dan objek; A²RD, arsitektur tanpa pelatihan untuk generasi video panjang per segmen; dan VQQA, yang menerapkan penyempurnaan prompt loop tertutup melalui pertanyaan jawaban visual.
Google mengevaluasi kerangka kerja ini menggunakan benchmark baru termasuk GenAD-Bench, HardContinuityBench, dan LVBench-C. Co-Director mencapai rata-rata 81.4 pada GenAD-Bench, sementara A²RD menunjukkan konsistensi hingga 30% lebih baik dan koherensi naratif 20% lebih baik pada video yang berkisar dari 1 hingga 10 menit.
Kode Co-Director dan A²RD tersedia secara publik di GitHub, dengan kode CANVAS menunggu rilis. Pipa lengkapnya belum menjadi produk komersial Google, tetapi kerangka kerja ini menargetkan masalah optimisasi global dan pelacakan keadaan dunia yang melekat dalam pembuatan video AI bentuk panjang.