
2.326 kelime · ~12 dk okuma
Geçenlerde bizim konularla alakasız bir okuma yapıyordum. Determinizm hakkında. Öyle hafif akşam okuması. Yok ya, Özgür İrade serisini tekrar elden geçiriyorum da bu aralar.
Kaynaklar arasında bir çelişki fark ettim. Daha doğrusu bu gerçek bir çelişki miydi yoksa ben mi konuyu anlamamıştım, emin olamadım. Normal aramalar sonuç vermiyor. Böyle niş sorular için de büyük dil modellerine hiç güvenmiyorum.
En iyisi forumlar. Orada bilen birileri gelip nokta atışı, konuya açıklık getiriyorlar genelde ve gidiyorlar. Bu sefer böyle bir kahraman denk gelmedi. Denk gelmediği gibi yapay zekadan yine kaçamadık.
Çünkü en beğenilen cevaplar belli ki yine bu dil modellerinin çıktılarıydı. Kopyala yapıştır yapmış birileri. Quora gibi yerler bunlarla dolu. Niye izin veriyorlar anlamıyorum.
Normalde 1-2 cümlelik bir cevabı olacak şeylere paragraflarca yazıyorlar ve kusursuz bir grammarle yazıyorlar. 100 metreden belli oluyor yapay zeka üretimi oldukları. Dedim madem uygun forum bulamıyoruz, kendi forumumuzu yaratalım. Sosyal medyaya sordum.
Sağ olsun bazı arkadaşlar sayesinde jeton düştü ama işin komik yanı oradaki cevapların da bazıları yapay zeka üretimiydi. Bu da kafamı kurcaladı biraz. Yakın gelecek böyle mi olacak acaba? Tüm internet bu modellerin çıktılarından mı ibaret olacak?
Belki de hâlâ hazırda öyle. Ölü internet teorisini savunduğu gibi belki de gördüğünüz hiçbir şey insanlardan gelmiyor. Selam fularsızlar, hoş geldiniz, sefa getirdiniz. Serimizin teknik kısmını geride bıraktık.
Bu noktadan sonra güncel yapay zeka furyasının bir kritiğini yapacağız. İyisiyle kötüsüyle. Tüm konuları tek bir final bölümüne sıkıştırmak istemedim. Ambala olursunuz.
Kısa kısa gidelim bence. İlk konumuz internetin geleceği. Demin bahsettiğim ölü internet birkaç sene önce yayılmış bir komplot teorisiydi. Kabaca iki kısmı ayırabiliriz.
İlk kısmına göre bildiğimiz internet 2016-2017 yılları gibi sizleri övmüş. O tarihten beri internetteki trafiğin çoğu sentetik. Yani insan kaynaklı değil. Giderek de daha sentetik hale geliyor.
Birbirimizle değil botlarla konuşuyoruz. Benim gerçek biri olduğumdan emin misiniz? Belki bir projeyim. Belki bu ses tamamen fake.
Belki başlarken organik biçimde başladı. Sonra gerçek Yossi Cohen gibi 2017 yılında bir yerde öldüm. Şimdi duyduğunuz sentetik bir versiyonum. Teorinin ikinci kısmı da bunun planlı olduğu.
Yani işin arkasında ABD devleti var veya dev şirketler var veya Soros, Sauron. Kimse artık favori kötü adamınız. Amaç halkı kontrol etmek. Ya bu arada bu halk da ne halkmış arkadaş.
Kontrol edile edile bitmedik. Aşılar kontrol eder, GDO'lu gıdalar, uçaklardan atılan kimyasallar, şehir suyuna karıştırılan flor, efendime söyleyeyim reklamlardaki subliminal mesajlar, MK ultra teknikleri yani bin tane ayrı şekilde kontrol ediliyoruz, evcilleştiriliyoruz. Artık iyice komada olmamız lazım. Belki de tüm bu teknikler anca yetiyor içimizdeki özgürlük ateşini söndürmeye.
Neyse bu teorinin ikinci kısmı pek ilgimi çekmiyor. İlkinin aksine ölçülebilecek, gözlenebilecek bir şey değil. Dahası şart da değil. İnternetin bir mezarlığa dönüşmesi tamamen doğal dinamikler sonucu da gerçekleşebilir.
Yalnız her halükarda teorinin altında yatan hisler ilgimi çekiyor. Çünkü çok daha eski ve tanıdık bir korkunun modern bir versiyonu olduğunu düşünüyorum. Gerçekliğin göründüğü gibi olmaması, her şeyin bir ilüzyon olması... ...ve bu ilüzyon içinde,
bu sahne üstünde yalnız kalma korkumuzun modern bir versiyonu. Nitekim mesele kontrolden ibaret olsaydı, demin saydığım şeylerden farkı kalmazdı. Ama farkında olmadan birbirimizden uzaklaşmamız, siber uzay içinde birer adacığa dönüşmemiz, aramıza da böyle sentetik okyanuslar girmesi esas mesele. Bu bana Invasion of the Body Snatchers filmini hatırlatıyor.
Klasiktir zaten, izlemediyseniz kesin bir ara oturup izleyin. Tam bunları işliyor. Orijinali 1956 yapımı, 1978'de yeniden çektiler. İkisini de severim ben.
Sonraki versiyonlarını izlemedim. Sakin bir kasabadaki insanları çaktırmadan kopyalarıyla değiştiriyorlar. Konu bu. Kopyalara da pod people deniyor.
Bir kozadan çıktıkları için. Podların bizim botlarla isim benzerliği olması güzel bir tesadüf. Gürültü, patırtı, kavga, dövüş yok. Günlük hayat devam ederken sessiz bir istila yaşanıyor.
Çünkü kimse zorla alıkonulmuyor. Her şey uyku Bir şeylerin değiştiğini fark ediyorsun da olan bitene tam uyanamıyorsun. Her şeyi çözdüğünde iş işten geçmiş oluyor. Hatta geride kalan son insan bile olabilirsin.
Bir başka korku klasiği olan The Thing de benzerdi buna. Yalnız o biraz daha küçük ölçekte işliyor. Tek bir düşman var, ufak bir grup içinde paranoya yaratıyor. Diğerindeyse toplumsal bir dönüşüm var.
Sanırım en temelde zihnimiz dışında olup bitenlerden bir türlü emin olamadığımız gerçeği yatıyor. Yani bu dünyanın gerçekliğinden, diğer insanların gerçekliğinden emin olamıyoruz. Neyse uzatmayalım, izleyin işte. Hatta zamanınız varsa 98 yapımı The Faculty filmi vardı.
Neredeyse birebir aynı konu, bir okulda geçiyor. Diğerleri kadar klasik olmasa da o da nostalji olur. Peki, hakikaten de internet botlarla mı dolu? Her başarılı komplo teorisi gibi, bu da bazı gerçeklerin üstüne kurulu.
Impervan'ın her sene yayınladığı bir rapor var. Bad bot raporu diyorlar. Onlara göre mevcut trafiğin yarısı sentetik. Yöntemlerini incelemedim.
Nasıl ölçüyorlar bilmiyorum. Muhtemelen trafik miktarına bakmıyorlardır. Çünkü trafiğin çoğu video. Belki gönderilen istek sayısına bakıyorlardır.
Özellikle zararlı olan ve basit yapıdaki botların oranında ciddi bir artış gözlermiş geçen seneden beri. Bunu da büyük dil modellerine yoruyorlar. Çünkü artık teknik açıdan vasat insanlar bile çeşitli işleri otomatize edebiliyorlar. Bot deyince benim aklıma ilk sosyal medya geliyor aslında.
Orada da uzun zamandır çeşitli platformlardaki hesapların %5'i ile %10'unun sahte olduğu tahmin ediliyordu. Ölü diyemeyiz yani çoğunluk insanlardan oluşuyor. Yalnız burada ilginç başka bir etki var. Bu hesaplar aşırı aktif olduklarından normal insanların davranışlarını değiştiriyorlar.
Onları botlaştırıyorlar. Sürekli olarak bilmediğimiz, anlamadığımız, normalde de ilgilenmediğimiz konularda tetiklenip alnık tepkiler vermeye zorlanıyoruz. Hem psikolojik açıdan zorlanıyoruz, herkes yaptığı için, hem de ekonomik açıdan. Algoritma bunu ödüllendiriyor.
Para veriyorlar bunun için. Başarılı olduğu kanıtlanmış belli içerik formatları var. Bot olsun, insan olsun herkes bunları taklit ediyor. Her hafta dünya çapında aynı muhabbetler dönüp dolaşıyor o yüzden.
Aynı öfke patlamaları yaşanıyor. Aynı mimler popüler oluyor. Yani internetin ölmesi için herkesin bot olması şart değil. Bot gibi davranması da yeterli.
Şimdi bu komplo teorisini bir kenara koyalım. İnternetin halen hayatta olduğunu, halinin vaktinin yerinde olduğunu düşünüyorsanız bile, 5-10 sene sonrasını hayal etmeye çalışalım. Bir noktada insan üretimi içerikler gerçekten de azınlığa düşecekler. Demin bu dil modellerinin çıktılarının forumları işgalinden bahsetmiştim.
Bu genelde manuel olarak yapılıyor. Yani birileri o soruyu modele soruyor, iyi bir çıktı aldığı zaman da çeşitli forumlara, bloglara, kopyala, yapıştır yapıyor. Az sayıda insan uğraşıyor bununla ve hızı da sınırlı. Böyle mi kalacak bu?
Yapay zeka agentleri var artık. Bu büyük dil modellerini kendi başlarına kullanan otonom programlar. Pazarlama akla ilk gelen örneği. Gitsin sağa sola sürekli reklam yazsın, belki insanların ağzından anlatıyor, anekdotlar uyduruyor ve bu sadece işin yazı kısmı.
Artık modeller birden fazla çeşit girdi ve çıktığıyla çalışabiliyorlar. Yazı yazıyorsun, resim üretiyor. Resim alıyor, video üretiyor. Hepimizin medya hesapları bunlar tarafından otomatize edilebilir.
Ne uğraşacaksın restoranlara gidip yemek fotoğrafı çekmekle, ne bileyim otellere gidip böyle şahane pozlar vermekle? Bırak onu yapay zeka kendisi yaratsın, senin resmini kalıp olarak kullanarak etrafı arka planını doldursun. Sponsorlu içerikleri de oraya gömsün, sabah akşam bunu yapsın. Tüm bunları endüstriyel boyutlarda yapmak da mümkün.
Yani belli bir amaç için, siyasi propaganda olur, başka bir şey olur, sabah akşam yapay zeka destekli kısa video, film, podcast üretirsin, sahte hesap ağları aracılığıyla bunları yayarsın. Nasıl engelleyeceksin? Üretim kısmını zaten engelleyemezsin de anca platformlara yüklenmelerini veya orada öne çıkmalarını engellemeye çalışabilirsin. Ama onlar da etkileşim üstünden millete para kazandırdıkları için sürekli bu engelleri aşmaya teşvik ediyorlar insanları.
Çok çok dikkatli bakmadığınız sürece, çok enerji harcamadığınız sürece bir insanın elinden çıkıp çıkmadığını pek ayırt edemediğiniz yazı, resim, video gibi çeşitli formatlardaki içerikler otomatik olarak her yere yayılabilirler. Şu an internet ölü olmayabilir. Bu bir komplo teorisi olabilir. İlginç bir düşünce deneyi olabilir.
Ama birkaç sene sonrası için baya gerçekçi bir senaryo. Bu konularda daha önceden kafa patlatmışsanız, lütfen bana yazın. Fikirlerinizi duymak isterim. Bu korkular ne kadar gerçekçi.
Yeni bakış açıları duymak isterim. Yazacak zamanınız yoksa da botunuza söyleyin, o yazsın. Sentetik bir internetin en garip yanı, sonraki yapay zeka modellerinin o internet ile eğitilecek olmaları. Onların yarattığı bilgiler de bir sonraki modele eğitecekler.
Bir noktada insan yapımı içerik tamamen devre dışı kalabilir. Bunun ileride nasıl bir sonucu olacak? Tüm meselenin merkezinde ölçek var. Son yıllarda yaşanılan gelişmeler genelde ölçekle alakalılar.
Bir dil modeli eskiden mesela şiir yazamıyorsa, planlama yapamıyorsa, basit matematik yapamıyorsa, yeni versiyonları zarif bir çözüm bularak bu engelleri aşmadılar. Modeli 10 kat, 100 kat büyüterek aştılar. Son bölümde incelediğimiz Transformer mimarisinin devrimciliği de nihayetinde ölçekle alakalı. Ne yapıyordu?
Aynı anda birçok kelimeyi dikkate alarak tahmin yapıyordu. Ve aynı anda birçok kelime tahmin ederek eğitiliyordu. Her şeyi paralelleştirdiği için popüler oldu. Yani biraz kaba saba bir durum var ortada.
Her şey dahadan ibaret. Daha fazla kaynak, daha fazla parametre ve daha fazla eğitim verisi. Tam olarak ne kadar eğitim verisi? Benim aşina olduğum ölçüt, aklıma ilk gelen ölçüt Wikipedia olur.
Wikipedia'nın en büyük kısmı İngilizce. Neredeyse 7 milyon makaleden oluşuyor. Çok geliyor düşününce ama kullanılan eğitim verisinin sadece ufak bir kısmı bu. Geçtiğimiz haftalarda Hugging Face birçok dilde ve birçok kaynaktan derlenmiş bir eğitim seti yayınladı.
Halka açık en büyük set. İsteyen kullansın kendi modelini eğitsin. Yaklaşık 100 Wikipedia büyüklüğündeydi. En büyük modeller bundan da fazlasını kullanıyorlar.
Bulabildikleri her şeyi çekiyorlar. Bu arada çektikleri içeriklerin telif hakkıyla korunup korunmamaları çok önemli değil. Eserleri kopyalamadığınız sürece, yani sonuçlarında aynen kullanmadığın sürece, bir kullanıcı gelip şu kitabı baştan sona yazar mısın dediğinde, o kitabı hakikaten yazmadığın sürece, tüm o bilgileri işlemek için kullanabilirsin. Bazı yerlerde özel olarak belirtirsen, büyük dil modellerince kullanılamaz dersen korunmuş oluyorlar.
Ama default hali her şeyin işlenmeye açık olması. Benim tahminim bu konudaki yasaların büyük dil modellerinden önce oluşturulmuş olması, arama motorları çünkü yıllardır var, onlar için bir şey yapmalılardı. Onların web sayfalarını gezip endekslemeleri için telife takılmamaları lazım. Herhalde bu mevcut modelleri de benzer bir statüye aldılar.
Zaten kaç ülkenin yasama er ki son birkaç yılda olan biteni kavrayıp ona göre düzenleme yapacak kadar çalışkan olacak ki? Düğünlerden vakit kalmıyordur. Sonuç olarak bu modeller veriye aç kardeşim. Önlerine geleni yiyorlar.
Eninde sonunda doğal veriler bitecek. Özellikle de yüksek kalitede olanlar. Yüksek kalite ne demek? Yani bizim WhatsApp grubundaki chat pek kaliteli değil.
Seviye yerlerde. Sizin anladığınız manada da yerlerde de bir makine açısından da yerlerde. kullanılan referansları başkası anlamıyor, dil bozuk, bir şey yapamaz onunla. Ama belli bir konuda uzmanlar tarafından yaratılmış, düzgünce yazılmış, düzgünce oluşturulmuş, hatta belli bir oranda şüphe içeren, çünkü şüphe dil modelleri için belirtmesi zor bir şey, bunlara sahip içerikler çok değerliler.
İnce ayar için kullanılacak içerikler de çok değerliler. Yani bazı modeli yarattıktan sonra onu alıp çeşitli işlerde uzmanlaştırmak istiyorsun. Diyelim ki mimarlık işleri için, diyelim ki hukuk işleri için. Bunlara özel komutlar kullanarak ince ayar yapman lazım.
O tip eğitim verileri de çok kısıtlı. Yeterince insan üretimi yok bu konularda. İki sene öncesinden bir makaleye rastladım. Yüksek kalite dil verisi Stockholm'un 2026'da biteceğini öngörüyorlar.
Düşük kaliteli stok da sonsuz değil, onun da 2030'la 2050 arası biteceğini söylüyorlar. Aynı dönemde dijital resimler de tüketilmiş olacak. Bir noktadan sonra gelişmeyi neyle sağlayacaksın? Bariz cevap, sentetik veriyle.
Yani başka dil modellerinin ürettiği sonuçlarla. Eğer onların yazdıkları hikayeler, çizdikleri resimler, insanlarınkiyle kıyaslanabilir düzeyde ise veri darboğazı aşılabilir. IBM Research birkaç ay önce bir yöntem geliştirmiş. Öğretmen olarak kullandığı bir büyük dil modeli var.
Asıl modelin temel eğitimini tamamladıktan sonra onu artık hangi konuda uzmanlaştırmak istiyorsan, yardımcı olacak verileri bu öğretmen modeli üretiyor. Yani iş o noktaya gelmiş ki. Temel modeli zaten metanın lamasından alabilirsin açık kaynak olduğu için. Üstüne ince ayar çekmek için de mesela IBM'e geliyorsun.
Şu şu şu konularda eğit onu diyorsun. Onlar da öğretmeni ona göre ayarlıyorlar. Sonra öğrenciler bir noktada mezun oluyor. Bu aslında zamanında AlphaGo'nun yaptığı gibi kendi kendiyle oynayarak gelişmesini andırıyor bana.
Serinin başında satranç ve dama üstünden bazı kavramları anlatmıştım ya, o akış içinde Go oyununu atladık. Satrançta insanların üstünlüğü biter bitmez yeni hedef olarak Go belirlenmişti. Go'daki olası hamle sayısı çok daha fazla. O dönemde bilgisayarlar bir amatörü bile yenemiyorlar.
Ta 2015 yılına kadar beklediler. Ama esas devrim 1-2 sene sonra AlphaZero ile geldi. Kendi kendiyle oynayarak sıfırdan öğrenebiliyordu. Sadece Go'yu da değil, birçok oyunu.
Zamanında Rosenblatt'ın Dama programı da bunu yapabiliyordu hatırlarsanız ama o yıllar boyunca uzman oyuncuların seviyesine çıkamamıştı. AlphaZero ise sadece birkaç saatlik eğitim sonrası. Dünyadaki en iyi satranç programı olan Stockfish'le karşılaştı ve 100 maçın 28'ini kazandı. Bu yeterince etkileyici gelmediyse, kalan 72 oyunun beraberlikle sonuçlandığını ekleyeyim, hiç kaybetmedi yani.
Sonrasında Go'yu da öğrenip benzer bir şey yaptı. Büyük dil modelleri de kendi kendiyle konuşarak veya birbirleriyle konuşarak daha iyi konuşabilir hale gelebilirler mi? Oyunların avantajını hatırlıyorsunuz. Bariz bir ödül mekanizması var.
Oyunu kazanıp kazanmadığını kendi kendine anlayabiliyorsun. Diğer işlerde böyle bir lüksümüz yok. Kendiliğinden oluşan bir ödül mekanizması yok. Yani daha iyi bir metin yazdığını, daha yaratıcı bir şeyler yazdığını nasıl ölçeceksin?
Biz dili böyle alfa zero gibi öğrenebiliyor olsaydık, bebekler de sadece birbirleriyle konuşa konuşa öğrenirlerdi. Yetişkinlerin sürekli müdahale etmesine gerek kalmazdı. IBM'in demin bahsettiğim metodu bir yardımcı olarak tasarlanmış. Yani veri setindeki boşlukları doldurmak için.
Eğer ana öğe o olursa ciddi sorunlar ortaya çıkıyor. Nitekim sadece birkaç gün önce Nature'da bir makale yayınlandı. Model çöküşü diye bir kavramdan bahsediyorlar. Kendi ürettiği sentetik verilerle beslendikçe bozuluyor.
Bu sorun belli bir modeli has değil. Generative modellerin genel problemiymiş. Akraba evliliği gibi düşünüyorum. Kendi içinde kaldıkça her nesilde biraz daha bozulup çürüyorlar.
Şimdi tekrar bugüne dönersek, şahsen internete yazdığım, konuştuğum her şeyin hâlâ hazırda işlenmiş olduğunu varsayıyorum. İşlenmek demek özümsenmek demek. Ürettiğimiz şeyler yapay zeka tarafından özümseniyor. İçlerindeki o yüz milyarlarca parametreden belki birkaçını oynatıyoruz her yazımızla, her yaptığımız videoyla.
Parametre ayak izi diye yeni bir ölçü duydursak mesela. En ileri modellerin ayarları bizim yüzümüzden ne kadar değişmiş? Belki günün birinde ona göre saygı görürüz. Vay bunun YouTube'da 10 milyon takipçisi varmış yerine, vay 10 milyon tane parametreyi etkilemiş gibi bir şey derler.
Şimdikinden daha saçma olmaz aslında. Varlığımızın değerinin bu şekilde ölçülme fikri bende biraz kafa yaptı. İnsanlık bir gün yok olup giderse bizden geriye tek kalan bir modelin, o an hayatta olan bir modelin, devasa matrizlerinden birinin köşesindeki sayılar olacak. Mirasımız diğer herkesin ve her şeyin mirasına karışmış vaziyette o matrizler de birbirine komşu olacak.
Bugünlük burada bitirelim. İnternet hala hayatta, biz de hayattayız şimdilik. Bir sonraki üfürüğümüz doğruluk üstüne olsun. Büyük dil modellerine güvenebilecek miyiz yoksa bunlar hayaller görmeye, alternatif gerçekler yaratmaya devam mı edecekler?
Bugün dinleyen herkese teşekkürler. Patronlarıma da teşekkür edeyim. Geleceğe miras bırakacağımız sayılar arasında onlara da yer vereyim. Boran Güney, Burak Özdemir, Bülent Boyacı, Zafer Faydalı, Çağlar Pir, Özen Kandıralı, Rıdvan Duran, Vedat Kürşün ve Emine Tekerek.
Hepinizle haftaya görüşmek üzere.
Bu transkript otomatik olarak oluşturulmuştur; küçük hatalar içerebilir.