Podcast

29 - Deepfake: Duyduklarınıza İnanabilir misiniz?

Reklam Alanı (Deneme)

Bölüm Açıklaması

Sesiniz size mi ait? Belki de artık değildir? Birileri yapay zeka ile sizin sesinizi kullanan bir algoritma yaratabilir. Ve ona istedikleri her şeyi söyletebilirler. Yepyeni bir döneme giriyoruz: Deepfake dünyasına hoşgeldiniz. Bu, artık kulaklarınıza bile güvenemeyeceğiniz bir dünya.



Sunan: Barış Özcan

Hazırlayan: Ant Arın Şermet, Berkant Gültekin

Ses Tasarım ve Kurgu: Metin Bozkurt

Müzik Seçimleri: Umut Barış Genç

Yapımcı: Podbee Media






Tüm bölümler ve daha fazlası için ⁠⁠podbeemedia.com⁠⁠'u ziyaret et!



----- Podbee Sunar -------



Bu podcast reklam içermektedir.

Bölüm Transkripti

2.327 kelime · ~12 dk okuma

Merhaba, ben Barış Özcan. 111 Hertz'e hoş geldiniz. Bir Star Wars hayranı olarak 25 Mayıs'ta gelecek olan Obi-Wan Kenobi dizisini heyecanla bekliyorum ve buna hazırlık için de geçenlerde 2019 yılında normalde çıkmış olan The Mandalorian dizisini yeniden izliyordum. Bu diziyi izleyenler hatırlar. Onunla birlikte hayatlarımıza Grogu diye bir karakter dahil olmuştu. Hani tüm internetin Bebek Yoda adını verdiği o sevimli küçük yaratık. İkinci sezonun son bölümünü izlerken o malum sahneyi görmek beni yeniden fazlasıyla şaşırttı ve aynı zamanda da düşündürmeye başladı.

Kullandığımız teknoloji 2021 yılında izlediğimiz bir diziye 1974 yılındaki görüntüsüyle aynı karakteri sokmayı nasıl başarmıştı acaba? Gördüğümüz şey gerçek miydi yoksa değil miydi? Çünkü baya baya gerçek gibiydi. Düşünüyorum da artık gördüğümüz ya da duyduğumuz şeylere ne kadar rahatlıkla inanabiliriz acaba?

İsterseniz size yaşanmış bir hikaye de anlatayım. Ve duyduğumuz seslere güvenip güvenemeyeceğimize bu hikayeyi dinledikten sonra hep birlikte karar verelim. Sıradan bir cuma günü. Londra'da bir öğleden sonra. Hikayemizin baş kahramanı çok uluslu bir şirketin yöneticilerinden biri. Bir İngiliz. Adını paylaşmadığı için biz ona aramızda Kevin diyelim. Bir gün Kevin ofisinde oturduğu sırada telefonu çaldı.

Transkriptin tamamını oku

Ahize'yi kaldırdı. Hattın diğer ucunda patronu vardı. Hadi ona da Johannes diyelim. Kendisi bir Alman. Johannes'in sesinde bir telaş vardı. Ufaktan panikliyordu. Kevin, kayıtlarda yeni fark ettiğim büyük bir muhasebe hatası var. Şirketimiz çok önemli bir ödemeyi yapmayı kaçırmış. Eğer bir an evvel ödemeyi yapmazsak yüklü bir geç ödeme cezası alacağız.

Ortada elbette bir sorun vardı ve bu sorun çözülmeliydi. Bunun için Kevin'in, Johannes'in paylaştığı hesap numarasına derhal para transfer edilmeliydi. Söz konusu bu para, yüz binlerce euro değerinde bir miktar. Bu yüzden Kevin bu isteği duyar duymaz biraz garipsedi ama öte yandan hattın diğer ucundaki ses, patronuydu, Johannes'di. Bu yüzden de itiraz etmedi, telefonu kapadı.

ve patronunun gösterdiği hesap numarasına gereken parayı gönderdi. Ödeme gerçekleşmiş ve kriz henüz büyümeden engellenmişti. Aradan çok değil, birkaç gün geçti. Kevin yine ofisindeydi ve yine telefonu çaldı.

Arayan yine patronu Yohannes'ti. Bir muhasebe hatası daha fark etmişti ve Kevin'in tekrar para göndermesi gerekiyordu. Kevin bu kez biraz daha eşkillendi. Bir hafta içinde iki muhasebe hatası. Üstelik bu kez parayı göndermesi gereken hesap bilgileri de biraz şüpheli görünüyordu. Emin olmak adına bu kez Kevin patronu Yohannes'i telefonla aradı. Ve konuşur konuşmaz gerçeklerle, acı gerçeklerle yüzleşti. Patronu Yohannes,

''Neden bahsediyorsun Kevin? Ne para transferi, ne hesap hatasından söz ediyorsun sen?'' diyordu. Bu kez panikleme sırası Kevin'deydi. Yüz binlerce euroyu kim bilir kimin hesabına göndermişti. Şimdi ise patronu gelmiş hiçbirinden haberi olmadığını söylüyordu. Peki neler oluyordu? Telefon çalıyor. Ama bu kez cep telefonu. Tam ofis telefonunda Johannes'le konuştuğu sırada kim arıyor olabilir?

Kevin telefonu açtı. Arayan patronu Johannes'ti. Ne? İki ayrı telefonda, iki ayrı hatta iki farklı Johannes. Bu nasıl olabilir? Kevin'in kafası karışmıştı. Cep telefonundan kendisini arayan Johannes'e, ''Eee bir dakika siz kimsiniz, kiminle görüşüyorum?'' diye sorar sormaz, çağrığı sonlanıverdi.

Peki ama neydi bu? Arayan Yuhannes'in şeytani ikizi falan mıydı? Yoksa işin içinde doğaüstü bir şeyler mi vardı? Biri onunla dalga mı geçiyordu? Yok canım yüz binlerce euroluk şaka mı olur? Yüz binlerce euro! Eyvah! Hemen polisi aramalı. Ha bir de sigorta şirketini. Şirkete gelen uzmanlar telefon kayıtlarını dinlediler, kopyalarını aldılar. Aradan geçen birkaç haftanın sonundaysa kararı açıkladılar.

Ortada doğaüstü herhangi bir şey yoktu ve hattın diğer ucundaki Yohannes'in şeytani ikizi falan değildi. Kevin başından beri bir bilgisayarla konuşuyordu. Daha doğrusu Yohannes'in sesini taklit eden bir deepfake ile. Deepfake. Bizler onu daha çok görsel dünyadan biliyoruz. Çünkü ilk olarak işitsel dünyada değil, görsel dünyada başladı. Fotoğraf manipülasyonu çok uzun zamandan beri var olan bir teknoloji. Adobe, Photoshop programını bundan 32 yıl önce, taa 1990 yılında piyasaya sürmüştü. Dolayısıyla Deepfake'in de kökleri daha çok görsel efektler alanında ortaya çıktı.

Bilmem hatırlar mısınız YouTube'un süperstarlarından BuzzFeed 2018 yılında bir video yayımlamıştı. Videoda ABD eski başkanı Barack Obama konuşuyordu. Öyle bir çağa giriyoruz ki bu çağda düşmanlarımız bizleri herhangi bir zamanda herhangi bir şeyi söylemişiz gibi gösterebilirler. Bunları asla söylememiş olsak bile.

diyordu Barack Obama. Bunları asla söylememiş olsa bile öyle diyordu. Çünkü duyduğumuz sesler, sözler aslında hiç söylenmemişti. Videodaki Obama tüm jestleri ve mimikleri ve elbette sesiyle oradaydı. Dudak hareketleri konuşmasını aynen takip ediyordu. Tam bir senkron halindeydi. Ama bu videodaki konuşma hayatta hiç gerçekleşmemişti. Bu bir deepfaked'i.

Tüm Deepfake teknolojisine rağmen Obama'nın konuşmasını seslendiren bir yapay zeka değildi. Onun sesini komedyen Jordan Peele taklit etmişti. Yani az önce duyduğunuz ses aslında yine gerçek bir insanın sesi. Bilgisayar tarafından sentezlenmemiş. Bunun aslında birkaç nedeni var. İlki dediğim gibi fotoğraf ve video manipülasyonunun geçmişi çok daha eskilere dayanıyor. O yüzden de çok daha olgunlaşmış bir teknoloji.

İkincisi ise yalnızca ilişkinin eskiliği ile ilgili değil, görüntü ile ses arasında çok temel bir farktan kaynaklanıyor. Görüntü, insan sağduyusuna göre çok daha uzamsal bir şey. Daha çok uzaya ve mekana ilişkin. İşte tam da bu nedenle onu haritalamak görece kolay ama ses öyle değil. Haritalamaya biraz daha direnen bir yapıda, dolayısıyla kopyalanmaya da.

O yüzden yapay zeka ile birinin sesini taklit etmeye çalıştığınızda elde ettiğiniz ses uzunca bir süre şöyle bir şeye benziyordu. kusurları belirgin, nispeten robotik duyulan bir ses. Bunun en önemli sebebi görsel materyalle işitsel materyal arasındaki farktan kaynaklanıyor. Tahmin edersiniz ki görsel bir materyali haritalamak bir ses klibini haritalamaktan çok daha kolay ve deepfaking çalışma mantığı tam olarak işte bu haritalama dediğimiz kavram üzerine kurulu. O yüzden manipüle edilen şey bir video olduğunda ortaya çıkan sonuç çok daha gerçekçi, çok daha inandırıcı oluyor.

Veya oluyodu desek daha doğru olur. En azından Photoshop'ı yaratan Adobe'nin Woku adlı teknolojisini tanıtana dek. Şimdi gelin hep birlikte bu teknolojinin tanıtıldığı 2016'da gerçekleşen Adobe Max konferansına götüreyim sizi. Hello everyone. You guys have been making weird stuff online. With photo editing.

Şimdi sahneyi gözünüzde canlandırmama izin verin lütfen. Koskoca bir salon, arkada dev projeksiyon perdelerinin olduğu bir sahne burası. Sahnede ise üç kişi var. Bize bu yeni teknolojiyi tanıtacak olan, Adobe'nin ses konusundaki arge araştırmalarının başında çalışan Zeyu Jin ve iki sunucu.

Sunuculardan biri yine bir Adobe çalışanı olan Kim Chambers, diğeri ise komedyen Jordan Peele. Evet evet, az evvel Obama'nın Deepfake videosunda Obama'nın sesini taklit eden kişinin ta kendisi. Derken, Ze Eugene bilgisayarının başına geçiyor ve Jordan Peele'in gerçekleştirdiği röportajdan bir ses kaydını insanlara dinletiyor. Bahsettiğim kayıt da şu.

Yatağımdan dışarıya zıplayıverdim ve sırasıyla önce köpeklerimi, sonra da eşimi öptüm. Kaydın çevirisi tam olarak böyle. Daha sonra Zeyujin çok ilginç bir şey yapıyor. Elindeki algoritma önce bu konuşmayı yazılı bir metne çeviriyor. Bunu basit bir text-to-speech teknolojisi gibi düşünebilirsiniz. Zeyujin daha sonra birkaç basit kopyala yapıştır hareketiyle sadece metin üzerinde değişiklik yaparak bu konuşmayı şuna çeviriyor.

Hatırlayın ses kaydında önce köpeklerini daha sonra eşini öptüğünü söylüyordu. Basit bir metin düzenlemesinin ardından ise Zeyujin bunun tam tersini elde etti. Şimdi bunda ne var ki? Ses kaydındaki şeylerin yerini değiştirmek zaten çok zor bir şey değil diyebilirsiniz. Ama bir yargıya varmadan evvel biraz bekleyin derim. Zeyujin daha sonra önündeki metne ses kaydında hiç olmayan bazı şeyleri de ekliyor. Karımı ve köpeklerimi kelimelerini siliyor ve bunun yerine Jordan'ı üç kez kelimelerini yazıyor.

Düşünün, Adobe bu teknolojiyi 2016 yılında tanıttı. Daha sonra ise Adobe cephesinden Voco'ya dair hiçbir yeni haber veya tanıtım gerçekleşmedi. Adobe, şirket politikalarının bu aracın yanlış amaçlarla kullanılmasını engellemek için algoritmayı ve programı kamu ile paylaşmamak olduğunu açıkladı. Bu teknolojiyle birinin söylemediği bir şeyi ona söyletebilirsiniz. Bunu yapmak, bilgisayar klavyenizi kullanarak birkaç satır yazı yazmak kadar basit.

Adobe bu algoritmayı şirket dışında hiçbir kaynakla paylaşmadı belki ama VOCO'nun tanıtıldığı etkinlikten bu yana 6 koca yıl geçti. Dijital dünyada bunu 4'le çarpabilirsiniz. Gerçek dünyadan 4-5 kat daha hızlı ilerlediği için bu dünyadaki gelişmeler. Bugün sadece 5 saniyelik bir ses kaydını kullanarak açık kaynak yazılımlarla kusurlu da olsa benzer sonuçlar elde edebilmek mümkün.

Peki ama bir yapay zeka nasıl oluyor da sesimizi veya yüzümüzü taklit edebiliyor diye mi soruyorsunuz? Cevaplayayım. Aslında çok da şaşırtıcı bir yöntem değil. Deepfake, gücünü deep learning'ten yani derin öğrenmeden alıyor. Siz ona taklit etmesini istediğiniz ses kayıtlarını veriyorsunuz. Yapay zekada yeni doğmuş bir çocuğun duyduğu sesleri anlaşılması güç bir şekilde bir nevi bebekçe taklit etmesi gibi ilk aşamada o sesleri taklit etmeye çalışıyor.

Yine bebeklerde olduğu gibi o garip sesler biraz zaman geçince anlaşılır bir forma bürünmeye başlıyor. Yeni doğmuş çocuğunuzun anne, baba demesi gibi yapay zekada sizin sesinizi datasına katıyor. Elbette başarılı bir deepfake elde etmek için sesinizin bu veri tabanına eklenmesi yeterli değil. Sizin konuşmalarınız, açıklamalarınız ve bundan biraz daha fazlasının bu veritabanına eklenmesi gerekli. Gerçeğe yakın bir ses taklidi elde etmek ancak bunların, bu parametrelerin sağlanması bunlarla adeta o çocuğun beslenmesiyle mümkün. Daha sonra ise bu anlaşılamayan ses dalgasını yapay zekanın haznesine eklenen bir yazı ve metinle birleştirdiğimizde ortaya robotik olsa da ne dediği anlaşılabilen bir ses çıkıyor.

İstanbul'un iklimi, Türkiye'de Karadeniz iklimi ile Akdeniz İİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİİ Ve bu sesi bebekler üzerinden düşünecek olursak ilk basit anlaşılır cümleler olarak değerlendirebiliriz. Üçüncü aşamadaysa iki farklı süreç eş zamanlı olarak ilerlemek zorunda. Bu iki süreçten ilki generic voice olarak adlandırılan sesinizin robotik kısımlarının temizlendiği ve aslında anlaşılır bir hale gelmesinin sağlandığı bir aşama. Ancak yine de bu aşama deepfake kullanımı için yeterli berraklığı sunamadığı için ikinci bir sürece daha ihtiyaç duyuluyor. Bu süreçse sizin sesinizden toplanan verilerin sıkıştırılma işlemi. Bu sıkıştırılma işlemi yapay zekanın çoklu bilgiyi damıtması, bunlar arasında korelasyon kurması ve bunu hızlı bir şekilde gerçekleştirmesi için şart. Sıkıştırılan veriler yapay zekanın düşünme sürecini mümkün kılıyor. Duyulan sesteki metalik ve mekanik frekansı yok etmek için de nöral bir vocoder kullanılıyor.

Şimdi size temiz ve çok dikkatli dinlediğinizde bile ayırt etmekte zorlanacağınız bir örnek sunmak istiyorum. Hazır mısınız? Şimdi bir düşünün. Tüm bunları size anlatmadan bu kaydı dinletseydim, böylesi gerçekçi bir sesin bir bilgisayar tarafından üretildiğini ayırt edebilir miydiniz?

İşte bölümün başında hikayesini paylaştığım telefonda yüz binlerce euroluk bir dolandırıcılığın kurbanı olan Kevin de fark edememişti. Deepfake teknolojisi son yıllarda giderek kusursuza yakın bir hale gelmeye başladı ve komedyen Jordan Peele'ın Obama'yı taklit ettiği kayıtta amacı da bu teknolojinin yanlış ellerde ne gibi sorunlara yol açabileceğini göstermek yani bir farkındalık yaratmaktı. Deepfake kayıtlar dezenfermasyon amacıyla kullanıldığında pek de dost canlısı sonuçlar doğurmayabilirler. Bunun en önemli nedenlerinden biri, biz kullanıcıların internetle olan ilişkisinin zaman içinde değişmiş olması.

Web'in ilk yıllarında ortada öyle çok büyük bir problem yoktu aslında. O zamanları hatırlar mısınız bilemiyorum ama sıradan internet kullanıcıları olarak yalnızca tüketici konumundaydık. Ama Web 2.0 sonrasında internetle onu kullananların ilişkisi ve yaklaşım biçimleri değişti.

Değişimin temelindeki nokta Web 1.0'a göre karşılaştıkları içeriğe reaksiyon gösterip kendi üretimlerine geçebilmesiydi insanların. Artık gördüğümüz bir bilgiyi yalnızca okumakla kalmıyoruz, onu beğeniyoruz, onu paylaşıyoruz, efendim retweet ediyoruz, üstüne üstlük kendi düşüncelerimizi de paylaşıyoruz. Dolayısıyla kullanıcılar için yeni katmanlar açıldı ve bunlar açıldıkça derinleşti. Derinleşen içeriklerin sundukları birçok tartışmayı da

beraberinde getirdi. Çünkü üretenler aynı zamanda birer tüketendir. Hala içinde bulunduğumuz böylesi bir ortamda gerçek olsun ya da olmasın ama sansasyonel olan bilgilerin çok daha fazla etkileşim aldığı artık araştırmalarla sabit. Ve deepfake ile üretilen içeriklerinde böylesi sansasyonel, şok edici bir tarafı var. Hiç beklemediğiniz ünlü birinin ağzından hiç beklemediğiniz sözleri ansızın duyabilirsiniz. Ama işin bunun da ötesinde daha tehlikeli bir tarafı var.

Deepfake içeriklerin gerçeğe çok yakın bir şekilde üretilebiliyor olması ve sosyal medyada dolaşıma girebiliyor olması beraberinde makul reddedilebilirlik sorununu doğuruyor. Bunun ne anlama geldiğini bilgisayar mühendisi Subhashanak Korn şöyle açıklıyor. Gerçekten korkunç şeyler söylemiş veya yapmış insanlar ses kayıtları veya videoları ortaya saçıldığında artık bunları kolayca inkar edebilirler. Çünkü her zaman sahte olduğunu iddia edebilirler. Belki de toplu olarak en büyük risk ortak hakikat algımızı hedef alıyor. Video ve ses bir olayın gerçekliğini kanıtlamak için neredeyse bir asırdır altın standardımız oldu. Sadece bir kaydın varlığının bile bir olayın gerçekleştiğinin kanıtı olarak kabul edilebileceğine dair güvenceyi kaybetmenin eşiğindeyiz.

Suvajana-Korn'a göre Deepfake'in varlığı gerçekle ayırt edilemez noktaya geldiğinde ortak hakikat algımız büyük bir tehdit altına girecek. Antropologlar, içinde bulunduğumuz çağ zaten post-truth yani hakikat sonrası çağı olarak adlandırmaya başlamışlardı. Bu, bilginin doğruluğunu kaybettiğimiz, hakikat zemininin ayaklarımızın altından kaydığı anlamına geliyor. Böyle bir çağda deepfake'in yaratabileceği sorunları bir kez daha gözden geçirmemiz gerekiyor.

Bu olumsuz etkileri ortadan kaldırmak için çeşitli çözüm önerileri yok değil. Bunların bir kısmı deepfake üretimi için kullanılan teknolojinin yanında, onu tespit edebilen yapay zeka teknolojisinin de geliştirilmesine devam edilmesi. Pinscreen isimli teknoloji şirketinin kurucusu ve deepfake geliştirme çalışmalarında dünyanın en tanınan isimlerinden biri olan Dr. Hao Li, Zor görünse de Deepfake'i zararlı amaçlar doğrultusunda kullananları tespit etmek için de teknolojiyi geliştirmeye çalışıyoruz diyor. Bunun bir noktada onların işine yaradığı da doğru. Ancak nasıl üretildiğinin prensiplerini anlamıyorsanız gerçekçi görüntüler üretme yeteneğiniz yoksa bunları etkili bir şekilde tespit etmenin yolu da yoktur.

Evet, böyle diyor Dr. Hawley. Ama buradaki oksimoronu fark etmek çok da zor değil. Uzmanlar bunu bir kedi fare kovalamacasına benzetiyor zaten ve eninde sonunda gerçeğinden ayırt edilemez sahte görüntüler ve seslerin ortaya çıkacağını öne sürüyorlar.

Bir diğer çözüm önerisi ise video veya ses kaydı yapan cihazların değiştirilemez bir elektronik imzayla kaydedilmesi, bu şekilde imzalanması. Kayıt cihazlarına kaydın gerçekliğini kanıtlayacak, taklit edilemez bir tür elektronik imza teknolojisi eklemek belki de yakın gelecekte zorunlu hale gelebilir. Uzmanlar, blok zincir konusunda geldiğimiz noktanın böyle bir teknolojiyi üretebilmek için yeterli altyapıyı bize sağladığı konusunda da hemfikirler, gördüğünüz gibi blok zincirin çok farklı kullanım alanları da böyle yavaş yavaş ortaya çıkmaya başlıyor. Birçok farklı disiplinde hakikat algımızın köreldiği, dünyanın giderek tahammülsüzleşip gerginleştiği bir çağda deepfake'in varlığının nasıl geri dönülemez sonuçlar doğurabileceğini tahmin edebiliyoruz.

Pierre Bourdieu'nun televizyon üzerine kitabında şöyle bir cümle var. Söylenecek olan şeyi bilmek için başkalarının ne söylediğini bilmek gerekir. İşte bu cümlenin dahi yeterli kalmadığı bir çağda söylemeler yeniden üretilirken biz neye, ne kadar güvenebileceğiz? Deepfake ile gerçeği birbirinden ayırmak bir nebze mümkün olsa da medya gücünün varlığı geniş kitleleri galeyağına getiremez mi?

Jordan Peele'ın Obama'yı taklit ettiği ses kaydının bir kısmını dinlemiştik hep beraber. O konuşmadan bir kısmı tekrar hatırlatmak istiyorum şimdi sizlere. Cevabını sanırım biliyoruz. Benim ağzımdan en azından halkın öğrenebileceği yerlerde söylemeyeceğim şeyleri söyletebilirler.

Tehlikeli bir zamandayız. İnternette gördüğümüz, inandığımız şeylere karşı daha uyanık olmalıyız. Güvenilir haber kaynaklarına kulak vermemiz gereken bir çağdayız. Kulağa basit gelebilir ama ancak bu şekilde ilerleyebiliriz. Bilgi çağı, hayatta kalmak ya da rezil bir distopiyaya hapsolmak arasındaki farkın anahtarı olacak.

Gitmeyin, gitmeyin. Durun bir saniye. Beni barış sandınız ama barış olmadığımı artık sizinle paylaşma vaktim geldi. Ben o değilim. Ya da belki de oyum. Artık kim bilebilir?

Bu transkript otomatik olarak oluşturulmuştur; küçük hatalar içerebilir.

Reklam Alanı (Deneme)