Cyber

Mengapa Video AI Bisa Terlihat Nyata, tetapi Detailnya Tidak Konsisten?

Video buatan kecerdasan buatan atau artificial intelligence (AI) semakin mampu menghasilkan tampilan yang menyerupai rekaman kamera sungguhan. Manusia

 Mengapa Video AI Bisa Terlihat Nyata, tetapi Detailnya Tidak Konsisten?
Cara Membuat Video Realistis, Image: DALL·E 3

fin.co.id - Video buatan kecerdasan buatan atau artificial intelligence (AI) semakin mampu menghasilkan tampilan yang menyerupai rekaman kamera sungguhan. Manusia terlihat bergerak secara alami, pencahayaan tampak realistis, dan lingkungan memiliki detail yang meyakinkan. Namun, ketika diamati lebih teliti, video tersebut terkadang memperlihatkan kejanggalan, seperti jari yang berubah bentuk, tulisan yang berganti, benda yang tiba-tiba menghilang, atau gerakan yang tidak sesuai dengan kondisi di sekitarnya.

Fenomena ini terjadi karena menghasilkan gambar yang tampak realistis berbeda dengan mempertahankan seluruh detail secara konsisten sepanjang video. Model AI mempelajari pola visual dari data pelatihan untuk menghasilkan gambar dan gerakan berdasarkan instruksi pengguna. Proses tersebut dapat menghasilkan adegan yang meyakinkan, tetapi tidak selalu mampu mempertahankan identitas objek, hubungan antargambar, dan perilaku fisik secara sempurna.

AI Menghasilkan Video Berdasarkan Pola Visual

Video AI tidak dibuat dengan cara yang sama seperti kamera merekam kejadian nyata. Kamera menangkap cahaya dari lingkungan, sedangkan model AI generatif menghasilkan gambar berdasarkan pola yang dipelajari melalui proses pelatihan.

Model video AI dapat dilatih menggunakan kumpulan gambar, video, dan deskripsi teks. Dari data tersebut, model mempelajari hubungan antara objek, warna, pencahayaan, sudut pandang, serta gerakan. Ketika pengguna meminta video seseorang berjalan di trotoar, misalnya, model akan menghasilkan rangkaian gambar yang menyerupai adegan tersebut.

Kemampuan mempelajari pola visual memungkinkan AI menghasilkan manusia dengan tekstur kulit yang realistis, pakaian dengan detail yang rumit, dan gerakan kamera yang terlihat alami. Namun, kemampuan ini tidak otomatis berarti AI memahami seluruh aturan yang berlaku di dunia nyata.

Akibatnya, seseorang dapat terlihat realistis ketika berdiri, tetapi bentuk tangannya berubah saat mulai bergerak. Kendaraan dapat memiliki desain yang meyakinkan, tetapi bentuk rodanya menjadi tidak wajar ketika kamera mengikuti pergerakannya.

Kesalahan tersebut muncul karena model tidak hanya perlu menghasilkan detail yang bagus dalam satu gambar. Model juga harus memastikan bahwa detail tersebut tetap masuk akal ketika adegan berkembang dari satu momen ke momen berikutnya.

Mengapa Detail Objek Bisa Berubah Sepanjang Video?

Video terdiri atas rangkaian gambar atau frame yang ditampilkan secara berurutan. Agar terlihat alami, setiap frame harus memiliki hubungan yang logis dengan frame sebelumnya.

Jika seseorang mengenakan jaket biru pada awal video, misalnya, warna jaket tersebut seharusnya tetap sama selama tidak ada perubahan yang memang terjadi dalam adegan. Begitu pula dengan bentuk wajah, jumlah jari, aksesori, dan benda yang sedang dipegang.

Dalam video AI, konsistensi tersebut tidak selalu terjaga. Ada beberapa faktor yang dapat menjelaskan mengapa detail visual berubah secara tiba-tiba.

1. Konsistensi Antargambar Masih Menjadi Tantangan

Ketika menghasilkan video, AI perlu memperkirakan bagaimana suatu adegan berubah dari waktu ke waktu. Model harus mempertahankan bentuk objek sekaligus memperhitungkan pergerakan kamera, perubahan posisi, dan interaksi antarbenda.

Tantangan ini semakin besar ketika beberapa objek bergerak secara bersamaan. Sebagai contoh, seseorang berjalan sambil membawa tas ketika kamera bergerak mengikutinya. Model perlu mempertahankan bentuk tubuh, posisi tangan, identitas tas, arah gerakan, dan hubungan seluruh objek dengan lingkungan.

Jika hubungan tersebut tidak terjaga dengan baik, tas yang semula berada di tangan kanan dapat terlihat berpindah ke tangan kiri tanpa gerakan pemindahan yang jelas. Pada situasi lain, aksesori bisa menghilang selama beberapa frame lalu muncul kembali dengan bentuk berbeda.

Dalam penelitian video generatif, persoalan ini dikenal sebagai konsistensi temporal. Istilah tersebut merujuk pada kemampuan mempertahankan karakteristik visual dan hubungan antargambar sepanjang waktu.

2. Bentuk Objek Tidak Selalu Dipertahankan

Benda di dunia nyata memiliki karakteristik fisik yang relatif tetap. Gelas tidak berubah bentuk hanya karena berpindah posisi, sedangkan roda kendaraan tetap memiliki struktur yang sama ketika dilihat dari sudut berbeda.

Model video AI dapat mengalami kesulitan mempertahankan karakteristik tersebut, terutama ketika objek bergerak cepat, tertutup sebagian, atau mengalami perubahan sudut pandang.

Sebagai contoh, sebuah mobil mungkin terlihat normal ketika melaju di jalan. Namun, ketika kamera mengikuti pergerakannya, bentuk spion, roda, atau bagian bodi dapat berubah secara tiba-tiba.

Perubahan serupa dapat terlihat pada tangan manusia. Jari yang saling berdekatan atau tertutup sebagian lebih sulit direpresentasikan secara konsisten karena bentuk dan posisinya harus disesuaikan dengan gerakan tangan.

Kesalahan semacam ini menunjukkan bahwa menghasilkan objek yang terlihat benar dalam satu frame berbeda dengan mempertahankan identitas objek tersebut selama seluruh video.

3. Tulisan dan Detail Kecil Dapat Berubah

Tulisan, logo, angka, dan pola rumit merupakan bagian visual yang juga dapat mengalami perubahan dalam video AI. Sebuah papan toko mungkin menampilkan nama yang terlihat jelas pada awal adegan, tetapi huruf-hurufnya berubah ketika kamera bergerak mendekat.

Hal serupa dapat terjadi pada nomor kendaraan, tulisan di kemasan produk, angka pada jam, atau tampilan layar ponsel. Detail tersebut bisa terlihat benar dalam satu frame, tetapi berbeda pada frame berikutnya.

Tantangannya bukan semata-mata kemampuan menghasilkan tulisan. Model tertentu mampu menghasilkan teks yang cukup baik. Persoalan lainnya adalah mempertahankan bentuk, susunan, ukuran, dan posisi setiap karakter ketika objek bergerak atau sudut kamera berubah.

Semakin rumit detail yang harus dipertahankan, semakin besar tantangan bagi model untuk menghasilkan rangkaian gambar yang konsisten. Meskipun teknologi terus berkembang, hasilnya masih bergantung pada kemampuan model dan kompleksitas adegan.

Mengapa Video AI Terkadang Melanggar Hukum Fisika?

Dunia nyata memiliki aturan fisika yang membuat pergerakan benda dapat diperkirakan. Benda yang jatuh dipengaruhi gravitasi, air mengalir mengikuti perbedaan ketinggian dan tekanan, sedangkan benda padat tidak dapat begitu saja menembus benda padat lainnya dalam kondisi normal.

Video AI terkadang memperlihatkan kejadian yang bertentangan dengan aturan tersebut. Sebuah gelas dapat terlihat menembus meja, bola yang jatuh tidak memantul secara wajar, atau bayangan bergerak ke arah yang tidak sesuai dengan sumber cahaya.

Model generatif dapat mempelajari banyak contoh visual yang menunjukkan perilaku benda di dunia nyata. Namun, mempelajari pola visual tidak sama dengan menjalankan simulasi fisika yang secara eksplisit menghitung gaya, massa, tumbukan, dan lintasan objek.

Dalam laporan teknis berjudul Video Generation Models as World Simulators yang diterbitkan OpenAI pada Februari 2024, pengembangan model video dibahas sebagai pendekatan untuk mempelajari dan menghasilkan representasi dunia melalui data visual. Meski demikian, model video tetap memiliki keterbatasan dalam menggambarkan sejumlah interaksi fisik secara konsisten.

Artinya, video dapat terlihat realistis tanpa sepenuhnya mengikuti hukum fisika. Pencahayaan, tekstur, dan gerakan kamera mungkin tampak alami, tetapi interaksi antara dua benda di dalam adegan belum tentu benar.

Mengapa Video AI Semakin Realistis?

Kualitas video AI terus berkembang seiring peningkatan data pelatihan, arsitektur model, metode pembangkitan, dan teknik pemrosesan informasi visual. Perkembangan tersebut membantu model menghasilkan gerakan yang lebih halus, detail yang lebih tajam, dan perubahan adegan yang lebih alami.

Salah satu pendekatan yang digunakan dalam teknologi video generatif adalah model difusi. Secara umum, model difusi mempelajari cara membentuk data dengan memulihkan pola dari proses yang melibatkan gangguan atau noise. Dalam penerapannya pada video, model berusaha menghasilkan rangkaian gambar yang sesuai dengan deskripsi dan konteks yang diberikan.

Namun, kualitas visual yang tinggi tidak otomatis menghilangkan kesalahan. Model dapat menghasilkan wajah yang realistis sekaligus gagal mempertahankan bentuk tangan. Model juga dapat menghasilkan gerakan kamera yang halus, tetapi membuat benda berubah bentuk ketika berpindah posisi.

Penelitian berjudul Temporally Consistent Transformers for Video Generation, yang dipresentasikan dalam konferensi International Conference on Machine Learning pada 2023, membahas tantangan dalam mempertahankan konsistensi temporal pada video generatif. Penelitian mengenai persoalan ini memperlihatkan bahwa hubungan antargambar merupakan salah satu aspek penting dalam menghasilkan video yang stabil.

Karena itu, kemajuan teknologi video AI tidak hanya diukur dari seberapa nyata gambar yang dihasilkan, tetapi juga dari kemampuan model menjaga konsistensi objek dan peristiwa sepanjang video.

Cara Mengenali Ketidakkonsistenan dalam Video AI

Ketika menemukan video yang tampak realistis tetapi keasliannya belum dapat dipastikan, beberapa bagian dapat diperiksa untuk menemukan kemungkinan kejanggalan.

Pertama, perhatikan tangan, wajah, dan pakaian. Amati apakah bentuk jari, karakteristik wajah, warna pakaian, dan aksesori tetap konsisten ketika seseorang bergerak.

Kedua, periksa objek yang berpindah posisi. Kendaraan, gelas, tas, dan benda lainnya seharusnya mempertahankan bentuk serta identitasnya selama adegan berlangsung.

Ketiga, amati tulisan dan simbol. Logo, nomor kendaraan, papan petunjuk, serta tulisan di layar dapat menunjukkan perubahan yang tidak wajar antargambar.

Keempat, perhatikan interaksi objek dengan lingkungan. Benda yang menembus meja, gerakan tubuh yang tidak sesuai dengan pijakan, atau bayangan yang berubah tanpa alasan dapat menjadi petunjuk adanya ketidakwajaran visual.

Kelima, putar video dalam gerakan lambat jika tersedia. Perubahan kecil yang sulit dikenali saat video diputar dengan kecepatan normal terkadang menjadi lebih jelas ketika diperiksa secara perlahan.

Meski demikian, satu kejanggalan visual tidak cukup untuk membuktikan bahwa video dibuat oleh AI. Rekaman asli juga dapat mengalami distorsi akibat kompresi, pencahayaan buruk, gerakan cepat, atau kesalahan pemrosesan kamera.

Sebaliknya, video AI berkualitas tinggi dapat memiliki sedikit sekali kesalahan yang mudah dikenali. Oleh sebab itu, pemeriksaan visual sebaiknya disertai penelusuran sumber asli, konteks kejadian, dan bukti pendukung lainnya.

Penutup

Video AI bisa terlihat nyata, tetapi detailnya tidak konsisten karena menghasilkan rangkaian gambar berdasarkan pola yang dipelajari, sementara mempertahankan seluruh hubungan visual dan fisik sepanjang waktu merupakan tantangan tersendiri. Perubahan bentuk objek, tulisan yang berganti, gerakan yang tidak wajar, dan interaksi fisik yang keliru merupakan beberapa contoh keterbatasan tersebut.

Penelitian modern mengenai video generatif menunjukkan bahwa konsistensi temporal, identitas objek, dan hubungan antargambar masih menjadi bagian penting dalam pengembangan teknologi ini. Kemajuan model telah meningkatkan realisme visual, tetapi tampilan yang meyakinkan tidak selalu menjamin bahwa seluruh detailnya benar.

Bagi pengguna internet, memahami perbedaan antara realisme visual dan konsistensi faktual semakin penting ketika video buatan AI sulit dibedakan dari rekaman asli. Pengamatan terhadap detail dapat membantu menemukan kejanggalan, tetapi pemeriksaan sumber dan bukti pendukung tetap diperlukan untuk menilai keaslian suatu video.

Referensi

  1. OpenAI. Video Generation Models as World Simulators. 2024.

  2. Wilson Yan, Danijar Hafner, Stephen James, dan Pieter Abbeel. Temporally Consistent Transformers for Video Generation. Proceedings of the 40th International Conference on Machine Learning, 2023.

Perbaiki Kalimat Pembuka yang JanggalHapus Detail Referensi yang Tidak Perlu

Berita Terkait