Foto Perempuan Hasil AI Tidak Pernah Ada: Cara Jujur AI Menciptakan Wajah Manusia

Lihat foto di bawah ini. Perempuan berambut hitam dengan senyum lembut dan cahaya jendela di wajahnya. Ia terlihat seperti bisa menjadi tetangga, rekan kerja, atau kenalan siapa pun. Faktanya: perempuan ini tidak pernah ada. Tidak ada kamera yang memotretnya, tidak ada momen yang diabadikan. Ia adalah gambar sintetis yang dibuat oleh kecerdasan buatan — dan gambar di bawah ini adalah contoh nyatanya, lengkap dengan proses pembuatannya tahap demi tahap.

Delapan tahap simulasi proses diffusion: dari noise murni (kiri) hingga gambar final (kanan). Ini ilustrasi yang disederhanakan dari prinsip kerjanya.

Bukan foto, tapi juga bukan sekadar lukisan

Model gambar AI seperti Stable Diffusion, DALL-E, atau Midjourney tidak memotret siapa pun. Namun ia juga bukan melukis dari imajinasi kosong. Ia "belajar" dari foto-foto manusia asli — jutaan di antaranya — lalu menciptakan wajah baru yang belum pernah ada.

Dari mana pengetahuannya berasal? Dari data latih: miliaran pasangan gambar dan teks yang dikumpulkan dari internet terbuka, seperti dataset LAION-5B. Di dalamnya memang ada foto pernikahan orang, foto profil, hingga foto jurnalistik. Sering kali diambil tanpa izin pemiliknya — dan ini adalah kontroversi privasi serta hak cipta yang sampai hari ini belum selesai.

Yang penting dipahami: model tidak menyimpan foto-foto itu. Ia tidak punya album. Yang tersimpan adalah pola statistik dalam bentuk angka (weights): bagaimana bentuk mata pada umumnya, bagaimana cahaya jatuh di kulit, bagaimana tekstur rambut, dan kata-kata apa yang menggambarkan semuanya. Ibarat seseorang yang tidak menghafal wajah siapa pun, tetapi menguasai "tata bahasa visual" tentang seperti apa manusia itu.

Cara kerja diffusion: memahat dari kabut

Teknik paling umum saat ini disebut diffusion, dan cara kerjanya elegan:

Saat latihan, sebuah foto asli ditambahi noise — bintik acak seperti TV rusak — sedikit demi sedikit sampai menjadi noise total. Model dilatih melakukan kebalikannya: menebak seperti apa gambar sebelum noise ditambahkan. Setelah diulang miliaran kali, model menjadi mahir "membersihkan noise".

Saat menghasilkan gambar, prosesnya dibalik. Dimulai dari noise acak total (langkah 50 pada ilustrasi di atas), model membersihkannya langkah demi langkah — biasanya 20 hingga 50 langkah — dipandu teks perintah seperti "potret perempuan, cahaya alami". Setiap langkah, model seolah bertanya: "kalau ini mau jadi wajah sesuai deskripsi, noise mana yang harus saya buang?" Perlahan bayangan samar muncul, bentuk wajah terbentuk, fitur menajam, hingga menjadi gambar final. Versi modern (latent diffusion) bekerja di ruang matematis yang dikompresi agar lebih cepat dan detail.

Hasilnya adalah susunan piksel yang benar-benar baru. Wajah yang muncul biasanya orang fiktif yang tidak ada di dunia nyata.

Tiga hal yang harus disampaikan dengan jujur

Pertama, AI kadang meniru foto latihnya. Fenomena ini disebut memorization: jika sebuah foto muncul berkali-kali di data latih, model bisa "menghafal" dan memuntahkannya kembali nyaris identik — termasuk wajah. Para peneliti sudah membuktikannya. Jadi klaim "selalu 100% fiktif" tidak sepenuhnya benar, walau kasusnya langka.

Kedua, wajah buatan bisa kebetulan mirip orang asli, dan yang lebih serius: model bisa sengaja dilatih ulang dengan belasan foto seseorang untuk menghasilkan wajah orang spesifik itu dalam pose atau situasi palsu. Inilah dasar teknologi deepfake — foto "skandal" atau "bukti" yang tampak asli padahal tidak pernah terjadi.

Ketiga, fondasi data latihnya bermasalah. Foto-foto manusia asli di dalamnya banyak diambil tanpa persetujuan, termasuk foto anak-anak dan foto pribadi. Jadi meski hasilnya sintetis, ia dibangun di atas foto orang-orang nyata yang tak pernah dimintai izin.

Masih bisa dibedakan?

Dulu mudah: jumlah jari aneh, gigi berantakan, teks ngaco di latar. Kini model-model terbaru sudah jauh lebih rapi sehingga cara visual makin tidak bisa diandalkan. Harapan yang lebih realistis ada pada standar seperti C2PA — semacam "sidik jari digital" asal-usul konten yang mulai dipakai kamera dan platform — serta alat deteksi AI, walau semuanya belum ada yang sempurna.

Penutup

Gambar manusia buatan AI adalah lukisan digital yang sangat canggih, dilukis dari ingatan statistik tentang jutaan foto manusia asli — bukan foto dari orang yang benar-benar ada. Memahami cara kerjanya bukan sekadar soal teknologi, melainkan bekal literasi: di era ketika wajah yang meyakinkan bisa lahir dari deretan noise, kemampuan untuk bertanya "apakah ini nyata?" menjadi keterampilan yang sama pentingnya dengan kemampuan membuatnya.

Catatan redaksi: Seluruh gambar wajah dalam artikel ini dihasilkan oleh AI dan diberi label dengan jelas. Ilustrasi 8 tahap diffusion adalah simulasi visual yang disederhanakan untuk menjelaskan prinsip kerja, bukan rekaman proses internal model yang sebenarnya.