Image to video AI, atau mengubah foto jadi video dengan AI, adalah cara membuat klip pendek dari satu foto: model memakai foto sebagai bingkai awal lalu menambahkan gerak, misalnya kamera yang mendekat perlahan, uap yang naik dari cangkir, atau kain yang tertiup angin. Untuk foto produk, hasil terbaik datang dari gerak kecil yang tidak menyentuh barangnya. Begitu model diminta memutar, membuka, atau memakai produk, risiko bentuk dan label berubah naik tajam.

Panduan ini untuk seller dan affiliate yang punya foto produk bagus tapi belum punya video. Kami membahas jenis gerak yang aman, cara menyiapkan foto sumber, menulis instruksi gerak, durasi dan rasio untuk TikTok dan Shorts, perkiraan biaya, serta cara memeriksa hasil sebelum dipakai jualan.

Cara kerja foto jadi video AI

Model video generatif membuat rangkaian frame yang bergerak. Dalam mode image to video, foto yang kamu unggah dipakai sebagai titik awal, dan model menebak frame berikutnya berdasarkan instruksi gerak yang kamu tulis. Yang dihasilkan bukan animasi dari objek tiga dimensi, melainkan tebakan visual yang terlihat masuk akal.

Kata kuncinya adalah "tebakan". Model tidak tahu sisi belakang produkmu. Kalau kamera diminta berputar ke belakang botol, model akan mengarang sisi belakang itu. Kalau tangan diminta membuka tutup, model akan mengarang mekanisme tutupnya. Hasilnya bisa terlihat meyakinkan di layar, tapi berbeda dengan barang yang dikirim.

Karena itu kami memperlakukan image to video sebagai alat untuk suasana dan perhatian, bukan untuk bukti. Bukti tetap datang dari foto atau video asli: produk dipegang, dibuka, dipakai. Klip AI dipakai untuk pembuka yang menarik mata, transisi, atau latar suasana. Pembagian peran ini juga yang kami pakai di cara membuat video produk AI dengan skrip pendek.

Sebelum mulai, pastikan kamu memang butuh video. Untuk foto utama marketplace, foto diam yang rapi masih menjadi standar. Video paling berguna di feed TikTok, Reels, Shorts, dan iklan, tempat gerak menahan jempol orang.

Gerak yang aman dan gerak yang berisiko

Aturan praktis kami: gerakkan kamera dan lingkungan, bukan produknya. Gerak kamera kecil seperti mendekat perlahan atau bergeser sedikit hampir tidak mengubah produk. Gerak lingkungan seperti cahaya yang bergeser, uap, daun, atau partikel debu menambah hidup tanpa menyentuh barang.

Perbandingan dua kolom gerak yang aman seperti kamera mendekat, cahaya bergeser, uap naik, dan gerak berisiko seperti produk berputar, tutup dibuka, produk dipakai tangan
Kolom kiri menambah suasana tanpa menyentuh produk. Kolom kanan memaksa model mengarang bagian yang tidak ada di foto. Diagram dibuat Tim Ruang Visual.
Jenis gerakRisiko produk berubahCocok untuk
Kamera mendekat perlahan (push in)RendahPembuka, menonjolkan detail
Kamera bergeser sedikit ke sampingRendah sampai sedangMemberi kesan ruang
Cahaya, uap, partikel, kain latar bergerakRendahSuasana makanan, minuman, kosmetik
Produk berputar penuhTinggiHindari, rekam video asli
Tangan membuka atau memakai produkTinggiHindari, rekam video asli
Orang memakai pakaian dari foto produkSangat tinggiButuh persetujuan dan label, cek kebijakan

Baris terakhir sering diminta oleh seller fashion. Membuat orang terlihat memakai pakaianmu menyentuh dua masalah sekaligus: produk bisa berubah, dan wajah atau tubuh orang bisa dipakai tanpa izin. Batasnya kami bahas di panduan keamanan dan moderasi deepfake AI.

Menyiapkan foto sumber

Kualitas video tidak akan melampaui kualitas foto sumber. Foto yang gelap, blur, atau terpotong akan menghasilkan video yang gelap, blur, atau terpotong, sering kali dengan tambahan kesalahan baru.

  • Rasio sejak awal. Kalau target video vertikal 9:16, mulai dari foto vertikal atau foto dengan ruang kosong cukup di atas dan bawah. Memaksa foto persegi menjadi vertikal membuat model mengarang tepi yang hilang.
  • Produk utuh dengan ruang di sekeliling. Gerak kamera membutuhkan ruang. Produk yang terlalu mepet tepi akan terpotong saat kamera bergerak.
  • Label menghadap kamera dan tajam. Label yang sudah buram di foto akan semakin rusak di video.
  • Latar sederhana. Latar ramai memberi model terlalu banyak benda untuk digerakkan secara aneh.

Kalau foto produkmu masih berantakan, rapikan dulu cahaya dan latarnya. Langkahnya ada di panduan edit foto AI untuk foto produk dan panduan hapus background foto produk. Foto yang sudah rapi juga lebih mudah dipakai ulang di banyak klip.

Menulis instruksi gerak

Instruksi image to video yang baik pendek dan spesifik. Sebutkan satu gerak kamera, satu gerak lingkungan paling banyak, dan apa yang wajib diam. Instruksi yang meminta lima hal terjadi dalam lima detik hampir selalu menghasilkan kekacauan.

Contoh untuk minuman:

Kamera mendekat sangat perlahan ke gelas. Uap tipis naik dari permukaan minuman. Gelas, isi gelas, dan semua tulisan pada gelas tetap diam dan tidak berubah bentuk. Tanpa teks, tanpa orang, tanpa objek baru.

Contoh untuk kosmetik:

Cahaya hangat bergeser perlahan dari kiri ke kanan di belakang botol, bayangan botol ikut bergeser sedikit. Kamera diam. Botol, tutup, dan label tetap sama persis dengan foto. Tanpa teks dan tanpa watermark.

Contoh untuk pakaian di gantungan:

Angin lembut menggerakkan ujung kain sedikit. Kamera bergeser pelan ke kanan. Warna, motif, kancing, dan jahitan tidak berubah. Tidak ada orang yang muncul.

Frasa "tetap diam dan tidak berubah" tidak menjamin hasil, tapi dari pengalaman kami membantu mengurangi gerak liar pada produk. Struktur instruksi yang lebih lengkap ada di panduan prompt AI bahasa Indonesia untuk produk.

Durasi dan rasio untuk TikTok dan Shorts

Kebanyakan model image to video menghasilkan klip beberapa detik. Itu bukan kelemahan untuk konten jualan, karena video pendek memang tersusun dari potongan beberapa detik. Yang penting adalah rasio dan resolusi sesuai platform tujuan.

PlatformKetentuan resmi yang kami periksaCatatan
TikTok (iklan In-Feed non-Spark)Vertikal 9:16 dianjurkan, minimal 540 x 960 pikselJuga menerima 16:9 dan 1:1
YouTube ShortsVideo vertikal, alat kreasi Shorts mendukung durasi hingga 3 menitSatu klip AI cukup sebagai bagian, bukan seluruh video
Situs sendiriBebas, sesuaikan dengan tata letakPakai poster frame supaya halaman tetap ringan

Ketentuan TikTok di atas berasal dari halaman bantuan TikTok Auction In-Feed Ads, dan ketentuan Shorts dari bantuan YouTube Shorts. Keduanya bisa berubah, jadi cek ulang sebelum produksi besar. Spesifikasi teknis lain seperti format file kami rangkum di panduan skrip video pendek.

Berapa biaya mengubah foto jadi video

Video adalah salah satu keluaran AI yang paling mahal, karena biayanya biasanya dihitung per detik keluaran. Sebagai patokan publik, halaman harga Gemini Developer API yang kami cek pada 9 Oktober 2026 mencantumkan Veo 3.1 tidak tersedia di tingkat gratis, dengan tarif berbayar per detik: Standard 0,40 dolar AS untuk 720p dan 1080p, Fast 0,10 dolar AS untuk 720p, dan Lite 0,05 dolar AS untuk 720p. Halaman yang sama menyebut biaya hanya dikenakan bila video berhasil dibuat.

Grafik batang tarif per detik Veo 3.1 di Gemini Developer API untuk 720p: Standard 0,40 dolar, Fast 0,10 dolar, Lite 0,05 dolar
Tarif per detik Veo 3.1 resolusi 720p menurut halaman harga Gemini Developer API, dicek 9 Oktober 2026. Tarif bisa berubah. Diagram dibuat Tim Ruang Visual.

Artinya, satu klip delapan detik di tingkat Standard bernilai sekitar 3,20 dolar AS sebelum pajak dan selisih kurs, sementara tingkat Lite sekitar 0,40 dolar AS. Selisih ini besar kalau kamu membuat puluhan variasi. Strategi yang kami sarankan: uji instruksi gerak di tingkat termurah, lalu render ulang hanya klip pemenang di kualitas lebih tinggi.

Layanan yang menjual kredit dalam Rupiah biasanya menambahkan biaya platform di atas tarif penyedia model. Cara membaca estimasi itu ada di panduan biaya kredit AI.

Memeriksa hasil frame demi frame

Video AI sering terlihat sempurna saat diputar sekali di kecepatan normal, lalu memperlihatkan kesalahan saat dijeda. Biasakan memeriksa minimal tiga titik: awal, tengah, dan akhir klip.

Daftar periksa klip image to video: bentuk produk stabil, label tidak berubah, tidak ada objek baru, tepi tidak terpotong, gerak tidak terlalu cepat, label AI disiapkan
Enam hal yang kami periksa dengan menjeda klip di awal, tengah, dan akhir. Diagram dibuat Tim Ruang Visual.

Kesalahan yang paling sering kami temui: label yang huruf-hurufnya "meleleh" di tengah klip, jumlah benda yang bertambah (dua sedotan menjadi tiga), dan produk yang sedikit membesar saat kamera mendekat. Klip dengan kesalahan seperti ini dibuang, bukan diperbaiki, karena memperbaiki video jauh lebih mahal daripada membuat ulang.

Soal label, YouTube meminta kreator mengungkapkan konten realistis yang dibuat atau diubah secara signifikan dengan AI. TikTok meminta label untuk konten AI yang memuat gambar, audio, atau video realistis. Klip image to video produk yang tampak nyata sebaiknya diberi label. Standar seperti C2PA Content Credentials juga dipakai untuk mencatat asal dan riwayat edit konten digital.

Menyusun klip jadi video jualan

Satu klip image to video jarang cukup untuk satu video jualan. Pola yang kami pakai untuk video 15 sampai 20 detik:

  1. Pembuka dua sampai tiga detik: klip AI dengan gerak suasana untuk menahan perhatian.
  2. Bukti: video asli produk dipegang, dibuka, atau dipakai.
  3. Detail: foto asli atau klip push in pada tekstur dan label.
  4. Penutup: produk dengan ajakan yang jelas, misalnya cek keranjang kuning atau link di bio.

Kalau kamu affiliate, susunan ini tetap berlaku, ditambah disclosure afiliasi yang jelas. Pembahasannya ada di panduan konten TikTok Shop affiliate. Untuk format testimoni, lihat panduan skrip video UGC produk, dan untuk tim yang mengerjakan banyak klien, pola approval ada di workflow konten AI untuk agensi.

Ruang Visual sedang membangun alur foto ke video yang dimulai dari brief terstruktur, estimasi biaya yang terlihat, dan review sebelum render. Produk masih beta tertutup dan render berbayar belum aktif. Lihat halaman fitur untuk alurnya, halaman harga untuk status paket, atau FAQ untuk status beta.

Pertanyaan yang sering diajukan

Apa itu image to video AI?

Image to video AI adalah mode pada model video generatif yang memakai satu foto sebagai titik awal, lalu menambahkan gerak sesuai instruksi teks, misalnya kamera mendekat, cahaya bergeser, atau uap naik.

Apakah foto produk bisa dijadikan video dengan AI tanpa mengubah produknya?

Bisa, kalau geraknya kecil dan tidak menyentuh produk, seperti kamera mendekat perlahan atau gerak lingkungan. Gerak seperti produk berputar atau dibuka tangan memaksa model mengarang bagian yang tidak ada di foto, sehingga risikonya tinggi.

Berapa durasi video yang dihasilkan dari satu foto?

Kebanyakan model menghasilkan klip beberapa detik per render. Untuk video jualan, klip itu dipakai sebagai satu bagian, misalnya pembuka, lalu digabung dengan video asli produk.

Rasio apa yang dipakai untuk TikTok?

Halaman bantuan iklan In-Feed TikTok menganjurkan vertikal 9:16 dengan resolusi minimal 540 x 960 piksel. Mulailah dari foto vertikal supaya model tidak perlu mengarang tepi yang hilang.

Berapa biaya mengubah foto jadi video dengan AI?

Biasanya dihitung per detik keluaran. Halaman harga Gemini Developer API per 9 Oktober 2026 mencantumkan Veo 3.1 mulai 0,05 dolar AS per detik untuk Lite 720p sampai 0,40 dolar AS per detik untuk Standard, dan tidak tersedia di tingkat gratis.

Apakah video hasil foto AI perlu diberi label?

Kalau tampak realistis, sebaiknya ya. YouTube meminta pengungkapan untuk konten realistis yang dibuat atau diubah signifikan dengan AI, dan TikTok meminta label untuk konten AI yang realistis.

Kenapa label produk berubah di tengah video AI?

Model menebak setiap frame, dan teks kecil adalah bagian yang paling sulit dipertahankan. Pakai foto dengan label tajam, pilih gerak kecil, dan buang klip yang labelnya berubah.

Sumber

  1. Google AI for Developers: Gemini Developer API pricing (dicek 9 Oktober 2026)
  2. TikTok Ads Help: TikTok Auction In-Feed Ads
  3. Bantuan YouTube: Mulai membuat video YouTube Shorts
  4. YouTube Help: Mengungkapkan penggunaan konten AI generatif
  5. TikTok Newsroom: New labels for disclosing AI-generated content
  6. C2PA: Content Credentials
Catatan Ruang Visual ditulis untuk membantu keputusan yang dapat diuji. Cek kembali kebijakan kanal dan konteks produk sebelum publikasi.