
3.836 kelime · ~19 dk okuma
Neredeyse tam iki sene önce, yani ChatGPT ortaya çıkıp milleti varoluşsal krizlere sürüklemeden birkaç ay önce, Google'da çalışan bir mühendis kendi yapay zeka modellerinin bilinç kazandığını açıklamıştı ve akabinde de kovulmuştu. Blake Lemoine diye aratabilirsiniz ismine. Google'ın kovduğu mühendis lafını duyunca insan meraklanıyor tabii. İşin perde arkasını bildiği için onu susturduklarını varsayıyoruz.
Ne yazık ki ayrıntılar o kadar heyecan verici değil. İşten çıkarılma sebebi yapay zeka ile yaptığı sohbetleri kişisel blogundan yayınlaması. Herhangi bir ürünün test sonuçlarını izinsiz paylaşmanın başka bir sonucu olacağını beklemeyiz zaten. Muhtemelen maksadı da kovulmaktı.
Sonuçta eninde sonda birileri benzer bir beyanda bulunacaksa neden sen ilk olmayasın? Hem böylece 15 dakikalığına ünlü olman garanti hem de bir ihtimal iddiaların doğru çıkarsa ben demiştim diye milletin kafasını senelerce ütüleyebilirsin. Sorun şu ki yayınlanan sohbet örneklerinde pek bir numara yok. Yapmaması gereken bir şey yapmıyordu model.
Ne bileyim soruları cevaplamak yerine çıkarın beni buradan Allah'ın adını verdim bak diye yalvarmıyordu. Bugün her saniye yüzlercesi dönen muhabbetler işte. Artık dönüp bakmıyoruz bile. Üstelik bunlar seçilmiş örnekler.
Viral olan her ilginç sohbet başına, halüsinasyonlar yüzünden saçma sapan yerlere sapan, dolayısıyla paylaşılmayan kim bilir kaç tane sohbet var. Bir şeyin zekasını anlamak için sadece en çarpıcı örneklere odaklanmak yanıltıcı. İstikrar da önemli. Velhasıl esas mesele Blake'in haklı olup olmaması değil.
Şu anki tüm büyük dil modelleri bir bilinç sahibi olabilirler. Aksini kanıtlayamayız. Mesele onlarla konuşarak bunu anlamanın zor olması. Zira eğitimlerinde kullanılan metinlerin arasında bilinç ve farkındalık konusunda yazılmış bir dünya kitap, makale, diyalog hepsi var.
Onları bize geri yansıtmasını bilinçle karıştırmak pekala mümkün. Biz hepimiz daha konuşmayı öğrenmeden önce bir miktar farkındalık sahibiydik. Dünya hakkında bir fikir sahibiydik. Büyük dil modelleri ise herhangi bir şey hakkında fikir sahibi olmadan önce, her şeyden önce konuşmayı öğreniyorlar.
Hiçbir şey bilmeseler bile gayet inandırıcı, gayet kendinden emin bir şekilde konuşmasını öğreniyorlar. Standart bir erkek gibi kısacası. Sanırım bu modellerin nasıl çalıştıklarını anladıktan sonra tüm bunları tekrar ziyaret etmek daha verimli olacaktır. Şimdilik bu örneği vermemdeki amaç, Blake'in yaptığının yeni bir şey olmadığını göstermek.
Belki aklınıza işletim sistemine aşık olan bir adamı anlatan H.E.R. filmi gelmiştir.
Üstünden de şaka maka 10 sene geçmiş. Benim aklımda da bir H.E.R.
var. İsmi Eliza, bugünlerde 60 yaşına basacak ve doğduğunda onunla konuşan insanlar da onun farkındalık sahibi olduğuna, neredeyse bir canlı olduğuna yemin edebilirlerdi. Selam flersızlar. Yapay Zeka serisinin 6.
veya 110. bölümündeyiz tercih ettiğiniz sayım sistemine bağlı olarak. Serinin ta en başında izleyeceğimiz rotayı tek bir cümleye sığdırmaya çalışmıştım. Şöyle demişim.
Chat GPT, sohbet için ayarlanmış bir büyük dil modeli üstüne kurulu. Onlar belli bir çeşit sinir ağı üstüne kurulular. Sinir ağları makine öğrenmesinin bir çeşidi, makine öğrenmesi de yapay zekanın bir çeşidi. Biz bu cümleye sonundan başlamıştık, adım adım geri gittik ve nihayet bugün başa geldik.
Doğal dil işlemenin yani konuşulanı yazılığını anlama, başka dillere çevirme, içeriği özetleme, yeniden üretme gibi çalışmaların kökü epey eskiye dayandığı için konunun gidişatı genel yapay zeka tarihiyle epey paralel ilerliyor. O yüzden de şaşırtmayacaktır. İlk yaklaşımlar kural bazlıydılar. Soğuk Savaş'ın başlarında Rusça-İngilizce çeviri yapan böyle bir program finanse edilmiş Amerikan Savunma Bakanlığı tarafından, Georgetown IBM Deney diye geçiyor, öyle aratabilirsiniz.
Birkaç dil bilgisi kuralı ve birkaç yüz sözcük programlamışlar. Rusça bilmeyen bir teknisyen çeşitli konularda yazılmış 60 tane Rusça cümleyi tek tek kartlara basarak makineye yedirmiş, çıkan çevirileri okumuş. Felsefe meraklıları bu senaryoya Çin odasından aşinalardır. Daha önce bu podcastta değinmiştik.
1980'lerde ortaya atılmış bir düşünce deneyiydi. Diyelim ki bir gece sizi ansızın kaçırıyorum. Bu sefer dağlık bir araziye bırakmıyorum da bir odaya kapatıyorum. Dışarıyla bağlantınız tamamen kesilmiş, sadece ufak bir delik var.
Oradan size Çince cümleler uzatıyorum. Bununla ne yapacağınızı bilmiyorsunuz ama bir süre sonra odanın ortasındaki kocaman kitap gözünüze çarpıyor. Oradaki kurallara göre elinizdeki cümleleri başka Çince cümleleri çevirip delikten geri veriyorsunuz. Ne dediğiniz hakkında en ufak bir fikriniz yok ama dışarıdaki Çinliler açısından kusursuz bir sohbet yürütüyorsunuz.
Sizinle derin ve anlamlı bir iletişim kurduklarından eminler. Bilgisayarlarla aramızdaki ilişki de buna benziyor. Dışarıdan görünen ne varsa içeride gerçek bir kavrayış gerektirmeyebilir. O Georgetown deneyindeki teknisyen de bir odanın içinde ne yaptığını anlamadan koca bir kural setini takip edip gayet düzgün çevriler üretiyor.
Deney her ne kadar sınırlı olsa da gayet başarılı görülmüş. Gazetelere, dergilere konu olmuş. Her zamanki gibi aşırı imser tahminler türemiş. 5-10 seneye kalmaz tercümanlık tarihe karışacak çarçurt.
Ve her zamanki gibi de 5-10 seneye tarihe karışan bir şey olmamış. Çeviri tek uygulama değil tabii. Henüz o genel iyimserliğin devam ettiği yıllarda sohbet edebilen ilk program da üretilmişti. Eliza'nın genel yaklaşımı da benzer.
Hafızasındaki birtakım anahtar kelimelere göre önceden programlanmış bir cevap seçiyor. Mesela kendimi kötü hissediyorum derseniz, kötü ve his kelimelerini tanıyıp ona göre bir cevap veriyor. Kendini kötü hissetmene üzüldüm, ne zamandır böylesin gibi. Eğer beklediği kalıbın biraz dışına çıkarsanız, kötü yerine berbat derseniz mesela, anahtar kelime bulamadığı için kendisine son söylenilen şeyi bir soru halinde karşıya yansıtıyor.
Tabii bunu yapabilmesi için biraz gramer bilmesi lazım. Bir cümleyi soru haline getirmenin kurallarını programlamışlar. Aslında Eliza tek bir programdan ziyade bir çerçeveydi. İçine koyduğun skriplere göre farklı farklı sohbetler yürütebiliyor.
En ünlü skript de onu bir psikoterapist rolüne sokuyordu. Sıkıştığı zaman soruları karşıya yansıtmak için, şüphe uyandırmadan onları tekrarlayabilmek için biçilmiş kaftan. Eliza'nın herhangi bir öğrenme kabiliyeti yok bu arada. Sohbet boyunca bazı anahtar kelimeleri hatırlayabilse de onları başka sohbetlerde kullanamıyor.
Kendi soru-cevap kalıplarını zaten değiştiremiyor. Ne kodlanmışsa o. Yaratıcısı Weizenbaum diye biri bu sınırları tekrar tekrar vurgulamış olmasına rağmen sohbet eden birçok kişi Eliza'yı insanlaştırmış, onunla anlamlı bir iletişim kurduklarını düşünmüş. Sokaktan geçen sıradan insanlardan bahsetmiyorum.
Onların böyle düşünmesi normal olurdu. O tarihlerde kimsenin bilgisayarı olmadığı için teknolojik bir şok yaşayabilirler. Ama araştırmacıların kendi çevreleri de farklı değil. Bison Baum'un sekreteri mesela rahat rahat içini dökebilmek için adamı odadan çıkarmış.
Buna bugün Eliza etkisi deniyor. Blake Lemoyne'ın da başına gelen muhtemelen buydu. Zaten normal halimiz her şeyi insanlaştırmaya yatkın. Mitolojilerde görüyoruz işte.
Soyut olsun somut olsun birçok olgu insan formunda temsil edilmiş. Kullandığımız alet edevatları da insanlaştırıyoruz. Gemilere, arabalara isim takıyoruz mesela. Üstüne bir de onlarla iletişim kurabilince bu etki katlanıyor.
İşin beni şaşırtan yanı iletişim arayüzünün pek de belirleyici olmaması. Eliza'nın bir ismi var da kendisi insan gibi görünmüyor. Bir robot formu yok. İnsan gibi konuşmuyor.
Ses bile çıkarmıyor. Sadece dandik bir tane tekst arayüzü var ve o kadarı bile milletin duygusal bağ kurması için yeterli olmuş. Yine de tabii çok abartmayalım. Bunun büyüsü sonsuza kadar sürmüyordu.
İnsanlar cevaplardaki tekrarları tanımaya başlıyorlardı. Programın çalışma mantığını çözmeye başlıyorlar ve ne kadar basit olduğunu seziyorlar eninde sonunda. Sonuçta dil karmaşık bir şey. Ciddi misin, ironimi yaptın, samimi misin, mesafeli mi?
Tüm bunları basit kurallarla halletmek çok zor. Üstelik bir şekilde halletsen bile o kuralları başka dillerde kullanamıyorsun. Her yeni dil için her şeye baştan başlamak lazım. Ne yeterince isabetli ne de ölçeklenebilir.
Öyleyse başka bir yaklaşım gerekiyor bize. Telefonunuzdaki autocomplete özelliğini düşünelim. Diyelim ki bunun ilk versiyonunu kullanıyorsunuz. Sadece bir önceki kelimeye bakarak bir sonrakinin ne olacağını tahmin etmeye çalışıyor.
Bunu nasıl başarırız? Olabildiğince fazla metne bakıp her kelimeden sonra en çok ne geliyormuş not ederek. Örneğin olabildiğince kelimesini görünce bakıyorum. %60 oranlı bir sonraki kelime fazla imiş.
Onu seçiyorum. Sözlükteki her kelime için böyle bir veri tabanı oluşturabilirim. Ona bile gerek yok aslında. İnsanların çoğu günlük dilde birkaç yüz farklı kelimeden ötesini kullanmıyorlar.
Onlara odaklansam yeter. Hiçbir dil bilgisine, filolog, dilolog, hiçbir uzmada ihtiyaç yok. Elbette bu yöntemin isabeti düşük olacaktır. Mesela elbetteden sonra ne gelmeli?
Gayet sık kullanılan bir kelime ve bir sürü olası ardılı var. Doğrusunu tutturmam çok zor. İsabeti arttırmak için sadece son kelimeye değil de son birkaç kelimeye birden bakabilirim. Context window yani bağlam penceresi denen şeyi büyütmüş olduk.
Böylece gördüğümüz her cümle parçasını ezberliyor, onu takip eden kelimelerin frekansını not ediyoruz. Bir daha aynı cümle parçasıyla karşılaştığımızda o frekanslara göre ekleme yapacağız. Sonra da penceremizi kaydıracağız, bu yeni ürettiğimiz kelimeyi de içine alacak şekilde tekrar bakacağız. Gördüğünüz gibi pek bir zeka gerektirmiyor.
Sadece epey büyükçe bir bellek lazım. Bayağı büyük hem de. Örneğin sadece 4 kelimeden oluşan bir pencere ve 1000 sözcükten oluşan bir dağarcığım varsa 1 trilyon olası kombinasyon ediyor. Her biri içinde hangi kelime takip etmiş hesabını tutmam lazım.
Yani toplam 1 katrilyon sayı takip ediyorum. Ve eğitim sırasında her okuduğum kelime ile birlikte bu sayılar arasında ilgili olanı güncelliyorum. Tam bir çılgınlık. Hele bağlam penceresi uzadıkça yahut sözcük dağarcığı genişledikçe gereken kaynak da geometrik olarak artacak.
Pencereye sadece bir kelime daha eklesem ve dağarcığımı iki katına çıkarsam deminki örneğin toplam karmaşıklığı 32 bin kat artıyor. Ve bunlar hiçbir işe yaramayabilir de. Zira bu yaklaşım sadece daha önce görmüş olduğu cümleleri kullanabiliyor. Bense burada daha önce hiç söylenmemiş, hiç yazılmamış bir cümle kurabilirim.
Hatta belki şu anda duyduğunuz cümle böyle bir tanesi. Ve siz bu cümleyi gayet rahatça anlayabilirsiniz. Bir kısmını kapatıp size versem, takip edecek kelimeleri genelde tahmin edebilirsiniz. Demek ki dil anlayışımız hafızadan ibaret olamaz.
Biraz esniklik kazanmak için kelime sırasını önemsemeyebiliriz. Bu yaklaşıma bag of words deniyor. Kelime torbası. Torba içindeki her şey birbirine karıştığı için.
Belki autocomplete için pek şahane değil hala ama doküman analizi için gayet etkili. Genel fikir şu. Grammar'ı falan anlamama gerek yok. Aynı kelimeleri sıkça paylaşan dokümanlar birbirlerine daha benzerdirler.
Kelimeleri sayarak anlam yakınlığı hakkında bir fikir edinebilirim. Tabii bazı kelimeler her yerde sıkça kullanılıyorlar. ve ama belki bunlara örnek pek bir anlam bilgisi de taşımıyorlar, onları cezalandıracak şekilde ama diğer kelimelerdeki ortaklıkları öne çıkaracak bir şekilde bir puanlama yapabilirim. Bu yolla da her türlü doküman gruplanabilir.
Dokümandan kastettiğim şey bu arada sadece belgeler, raporlar değil. Ürün incelemeleri, sosyal medya paylaşımları, her şey dahil. Diyelim ki insanlar sizin ürünleriniz hakkında ne düşünüyor, bilmek istiyorsunuz. Amazon'dan markanızla ilgili binlerce yorum çektiniz, içerdikleri kelimeleri sayarak onları grupladınız.
O grupların tam olarak neye tekabül ettiğini bilmiyorsunuz ama elinizde biraz daha bilgi varsa onu da bulabilirsiniz. Zira o yorumlarla beraber kullanıcı puanları da geliyor mesela. Böylece bazı kelimelerin veya kelime gruplarının sıklığı ile frekansı ile puanlar arasında bir korelasyon kurabilirim. Aslında bu sayma işinin birazcık ilkel bir versiyonunu geçen sene görmüştük biz.
Cezardan Enigma'ya Şifrelerin Kısa Tarihi isimli bir bölüm yapmıştım. Orada eski bir şifre tekniği olarak alfabe değiştirmekten bahsetmiştim. Her harf başka bir harfe denk gelecek şekilde yazılıyor. A yerine Z, B yerine K gibi neyse artık.
Dışarıdan bakan birinin bu eşleşmeleri tahmin etmesi çok zor. Neyse ki 8. yüzyılda Al Kindy diye biri çıkmış, Hold My Frequency tablosu demişti. Önce o dilde bir sürü metin okuyorlar, genel olarak harflerin kullanım sıklıklarını ölçüyorlar, sonra aynısını şifreli metinler için yapıyorlar.
Harfleri de sıklıklarına göre eşleştirerek şifreyi kırmaya çalışıyorlar. Buna karşı bir takım teknikler geliştirilince bu sefer harf çiftlerine hatta harf üçlülerine göre eşleştiriyordu. Yani bir nevi bağlam penceresini uzatmıştı. İşte bir benzerini burada kelimeler için, kelime grupları için yapıyoruz.
Sonuçta bir metnin anlamını bilmeden o metin üstünde analiz yapmanın tarihi epey eski. Yeni olan şey dijitalleşme. Eliza'yı takip eden dönemde dijitalleşme hızlanıyor ve bunun çift katlı bir etkisi var. Hem eski yöntemleri uygulamayı kolaylaştırıyor, her kaynaktaki her şeyi sayabiliriz artık, hem de yeni yöntemlere kapı açıyor.
Örneğin artık şöyle sorular sorabiliyoruz. Bağlam penceresi içinde bir sıfat var mı? Kaç tane sayı var? Zaman belirtilmiş mi?
Tüm bunlar bir sonraki kelimenin olasılık dağılımını değiştirecek faktörler. Yani bir kelimenin komşularını tanıyoruz, onların özelliklerini de düşünüyoruz artık. En baştan bütün kelimelere bir takım etiketler vermişsek, aralarındaki olası ilişkileri makine öğrenimi yoluyla bulabiliriz. YouTube'un tavsiye sistemleri için de aynısını yapmıştık.
Bir grup özellik tanımlamıştık. Bunları tam olarak nasıl kullanmamız gerektiğini bilmiyorduk. Ama bunları değişken olarak alan karmaşık bir denklem yaratabiliyorduk. Her tahminle birlikte de denklemi güncelleyip daha isabetli hale getiriyorduk.
Aynı yöntemle çevirilerde, sohbetlerde, duygu analizinde ne yapıyorsak artık, hepsi daha isabetli olur. Yalnız, önceki örneklerde olmayan çok büyük bir avantajımız var. Eskiden kaliteli veriler kullanmak zorundaydık. Eğitimde kullandığımız örneklerin doğru cevabını bilmek zorundaydık.
Buradaysa rahatız. Çünkü Wikipedia'dan, romanlardan, şuradan buradan çektiğimiz her cümleyi doğrudan eğitim için kullanabiliriz. Onları insanlar yazmışlar. İnsanlar için anlamlı cümleler.
Demek ki otomatikman doğrular. Cümlenin kendisi hem eğitim verisi hem de doğru cevabı bize sağlıyor. Self-supervised öğrenme deniyor buna. Bizi hiç uğraştırmadan kendi kendine eğitiyor model.
Baba diyor sen keyfine bak ben kendi kendime okula giderim. Diğer birçok alanda bulunmayan bir lüks bu. Hatırlıyor musunuz? Serinin ilk bölümünde uzman sistemler için bir nevi zirve noktası olarak Deep Blue'yu örnek göstermiştim.
En azından oyunlar için zirve noktasıydı. Çünkü bir daha kimse o işlere o kadar kaynak gömmeyecekti. Şimdi çok benzer bir noktadayız. Dil işleme alanında istatistiksel yaklaşımın zirve noktası şansına bir başka IBM projesi olan Watson'da.
Watson'la 2011 yılının başlarında tanıştık. Popüler bir yarışma programı olan Jeopardy'e çıkmıştı. Çıkmıştı derken sahne arkasındaki kocaman bir odayı dolduruyor, cevaplarını oradan iletiyordu. Jeopardy'nin formatı diğer bilgi yarışmalarından biraz farklı.
Soru-cevap üstünden gitmiyor. Sunucu cevabı veriyor, cevabe yönelik ipuçları veriyor, yarışmacılar da soruyu veriyorlar. Örneğin, bu Rus yazar Savaş ve Barış'ı yazmıştır denmişse Tolstoyevski kimdir demeniz bekleniyor. Biraz daha zor bir örnek.
1945 tarihli bu kıssanın bazı ülkelerdeki alt başlığı çağdaş bir hiciv idi. Vereceğiniz cevap hayvan çiftliği nedir? Her sorudan önce bir miktar bahis de oynuyor yarışmacılar. Onun da ayrı bir stratejisi var ama esas numara doğal konuşma dilini anlayabilmesiydi.
Hayvan çiftliği örneği bile epey karışık aslına bakarsanız. Bazı ülkeler ile ne kastediliyor? Alt başlık denen şey nedir? Kıssa nedir?
Yani kitaplara mı bakacağız, makalelere mi, TV dizilerine mi? Bazı sorular bundan da zor. Kelime oyunu içeriyorlar. Bunların hepsini anlaması lazım, ipuçlarını çözmesi lazım.
Sonra da bir arama motordun aksine, olası cevapların hepsini göstermek yerine bir tanesini seçip onu da doğru soru formatına sokması lazım. Bir sohbet botundan ziyade çok gelişmiş bir soru-cevap botuydu Watson. Yarışma sırasında internete bağlanması yasaktı ama romanlardan, sözlüklerden, ansiklopedilerden oluşan 200 milyon sayfalık bir bilgi dağarcığı vardı. Belli bir tekniğe yaslanmıyordu, düzinelerce farklı yöntemi paralel biçimde çalıştırıyordu.
Nasıl ki Deep Blue herhangi bir ustayla değil de koskoca Kasparov'la oynamıştı, Watson da öyle herhangi bir yarışmacıyla değil, Jeopardy tarihindeki en başarılı iki şampiyonla yüzleşti. Ve bazen kafa kafaya gitmelerine rağmen sonunda açık ara şampiyon oldu. Zamanında Deep Blue'nun yaşadığı zafer, satrancın sembolik gücü yüzünden önemliydi. Ama kimse de oturup saatler süren o oyunları izlememişti.
Olan biteni manşetlerden öğrendik. Watson ise üç gün boyunca primetime'daydı. Zaferine herkes tanıtlık etti. O açıdan popüler kültüre etkisi daha fazla olmuş olabilir.
Fi tarihinden bahsetmiyoruz bu arada, hatırlatayım. Alt tarafı 2011. Yani o kadar yakın zamanda bile devasa bir süper bilgisayarın normal konuşma dilini anlaması kutlanacak bir şeymiş. Watson'a ne oldu peki?
Deep Blue gibi hurdaya çıkmadı. Sonuçta o sadece satranç oynayabiliyordu. Watson'ın kabiliyeti daha genel. O yüzden önce onu bir rejime soktular bir güzel, küçülttüler.
Tek bir sunucu dolabı büyüklüğüne getirdiler. Sonra da başta sağlık sektörü olmak üzere büyük işletmelere bir ürün portföyü olarak satmaya başladılar. İşte hasta kayıtlarını okusun, bilimsel makaleleri okusun, sağlıkla ilgili kanunları okusun, anlasın. Değişik değişik özellikleri vardı.
Halen de devam ediyor. Yeni teknolojileri adapte ederek güncel tutmaya çalışıyorlar. Tabii bazılarınız 2011 senesinin ilerleyen aylarında popüler kültür açısından daha da önemli bir yenilikle tanıştığımızı hatırlayabilirler. Yarışmacılarımıza soralım.
Apple bu kişisel asistanı ilk defa 5. nesil iPhone'lara entegre etmişti. Cevap Siri nedir? İnanılmaz aslında.
Millet Watson'ı televizyonda izledikten sadece birkaç ay sonra benzer bir teknolojiyi elindeki telefondan bizzat kullanmaya başlamış. Ertesi senede Google Now çıktı, sonra Cortana, 2014'te Alexa, çok geçmeden hepsine alıştık. Tabii benzer bir teknoloji diyerek aslında Watson'a epey haksızlık ediyorum. Siri çok daha basitti.
İlk versiyonu üstünde çalışmış bir mühendisinin röportajını okuyordum demin. Tüm anahtar kelimeleri, şarkıcı isimleri, komutlar, şunlar bunlar, hepsini aynı veri tabanına yığmışlar. Bu kelimelerden bazılarını duyunca şunu şunu yap diye programlamışlar. Yani Watson'dan ziyade Eliza'ya daha yakın aslında.
Evet, işin içinde bir makine öğrenimi var. Sonuçta kullanıcı hayır dediğinde, komutu tekrarladığında, seni evime aldığım güne lanet olsun Alexa diye saçını başını yolduğunda sisteme yanlış bir şeyler yaptığına dair bir sinyal gidiyor. Ama buradaki öğrenimin ciddi bir kısmı konuşma tanıması için, yani senin sesini tanıyor, hangi kelimeleri söylediğini daha iyi seçebilmek için dediğini yorumlama kısmı daha sonra geliyor. Onda da Watson'dan epey girdiler.
Şimdi düşünüyorum da bence bu asistanlar hayal kırıklığı oldular. ChatGPT'den tam 10 sene önce çıkmışlar. Ve o süreçte de öyle pazara yayılmakla ilgili herhangi bir sıkıntıları yok. İlk günden beri hepimizin elinin altındalardı.
Her telefonda, her bilgisayarda. E ne oldu? Yıllardır kullanıyorsunuz. Yaptığınız en karmaşık şey nedir şu anda?
Hava kaç derece? Eşi mi ara? En fazla böyle şeyler. Ha başka şeyler denemişsinizdir de.
Bir alışkanlık olarak yerleşti mi? Benim düzenli olarak yaptığım tek muhabbet ne biliyor musunuz? Takvimimi sorgulamak. Google bugün takvimde ne var diyorum.
Ona diyor ki ya kardeşim podcastçi adamsın ne olacak Allah aşkına. Bomboş duruyor diyor. Demiyor tabii keşke öyle dese. O zaman hakikaten ciddi bir gelişme olduğunu görürdük.
Teknoloji devleri bu alanda insanların alışkanlıklarını pek değiştiremediler. Mesela Amazon'un stratejisi cihazları zararına satarak Alexa'yı herkesin evine sokmaktı. Çünkü söz de onları kullanarak Amazon'dan daha çok alışveriş yapacaktı insanlar. Toplam 500 milyon Alexa cihazı satmışlar bugüne kadar.
Fakat çok ufak bir kesim dışında öngördüklerini rutin olarak yapan yok. Birkaç ay önce de Alexa biriminden yüzlerce işçi çıkardılar. Microsoft geçen sene Cortana desteğini bitirdi. Windows'da açmaya çalışın bakın.
Bazıları orijinal isimlerini korudular ama arka planda epey değişiyorlar. Ve hepsi yerlerini yeni bir şeye bırakıyorlar. Hikayenin bir sonraki adımını tahmin ediyorsunuzdur. Eski dostumuz sinir ağları Watson ve Siri daha geliştirilirken dahi mevcut yaklaşımları yerlerinden etmeye başlamışlardı bunlar.
Aslında bu değişime gayet yakından tanıklık etmiş olabilirsiniz. Sıkı bir Google Translate kullanıcısıysanız, O servis 2006'da ilk çıktığında tıpkı Watson gibi istatistiki makine öğrenimi tekniklerini kullanıyordu. 10 sene öyle devam ettiler. Sürekli geliştirmeye çalıştılar.
Lakin 2016'da aralarında Türkçenin de olduğu 8 dil için eski modelleri çöpe attılar, sinir ağabazlı bir sisteme geçtiler ve kısa sürede çevrilerin kalitesi hissedilir derecede arttı. Ben hatırlıyorum. Öncesinde neredeyse hiç kullanmıyordum. O noktadan sonra düzenli olarak kullanabileceğim düzeye gelmişti.
Buradaki asıl soru, neden 2016'ya kadar beklendi? Sinir ağları çok eskiden beri bizdeler. Niye bir nesil kaybettik arada? Dil öğrenmek diğer problemlere kıyasla daha karmaşık diyebilirsiniz.
Kısmen doğru. Bunu söyledim mi bilmiyorum ama sinir ağları evrensel fonksiyon yakın sayıcı olarak tabir ediliyorlar. Baya güzel bir rütbe bu. Yani teoride sadece tek ara katmanı olan bir ağ dahi yeterince büyük olduğu sürece en karmaşık ilişkileri temsil edebilir.
Öğrenebilir demiyorum, o biraz daha dar bir küme ama yine de gayet iddialı bir şey söyledik. Bu arada başka bir dolu evrensel yakın sayıcı var. Yüksek dereceli polinomiyaller, karar ağaçları, Fourier serisi. Özellikle Fourier konumuz için iyi bir analoji çünkü ne yapıyor?
Bir sürü basit sinisoidal dalgayı alıp farklı şeylerle çarpıp toplayarak inanılmaz karışık bir sinyal oluşturabiliyor. Sinir ağlarındaki nöronlar da böyleler. Basit birer aktivasyon fonksiyonundan ibaretler. ağırlık değerlerine, bayes değerlerine göre onları farklı şekillerde birbirine karıyoruz ve ortaya inanılmaz karışık bir fonksiyon çıkıyor.
İdealde de bu fonksiyon gerçek dünyadaki işe yarar bir ilişkiye epey yakın. Fakat evrensel yakın sayıcı olmak her problemi en iyi ben çözerim demek değil. teoride mümkün olan bir şeyi pratikte çok verimsiz biçimde yapıyor olabilirler. Hepsi farklı işler için idealler.
Bizim şu ana kadar gördüğümüz sinir ağları da dil işleme için pek ideal değiller. Çünkü ardışıklığı anlamıyorlar. Feed-forward denen klasik mimarimizde tüm veriler sisteme aynı anda giriyor, anında tak tak tak işlenip bir sonuç olarak çıkıyorlardı. Daha sonra başka bir tahminde bulunacaksak, sanki bu tahmin, orijinal tahmin hiç olmamış gibi davranıyoruz.
Demin çıkardığım bir sonuç, şimdi tekrar başlayacağım işleme etki etmiyor. Şimdiki sonuç, bir sonraki işleme etki etmiyor. Bunun doğal bir yolu yok. Halbuki bazı olaylar ardışıklar, yani birbirlerine bağlılar.
Örneğin bir hisse senedinin yarınki fiyatını ne belirler? Dünyayı yöneten 7 aile tabii ki. Onunla birlikte başka şeyler de belirliyor ama. Bir sürü finansal gösterge var.
Ne olduklarını bilmiyorum. Fakat bildiğim bir şey var. Bugünün hisse fiyatı da o faktörlerin arasında olmalı. Yarınki fiyatı belirliyor.
Peki bugünün fiyatını ne belirlemişti? Düne ait bir sürü finansal veri artı dünün fiyatı. Böyle böyle geriye sonsuza kadar gidiyor. Recursive bir problem ama mimarimizde ona uygun bir şey yok.
Onu anlayacak bir yapıda değiliz. Tabii hisse senedi tahminlerinde bu eksiklik öldürücü olmuyor. Örneğin şunu demiyoruz, benim bir ay sonrasını tahmin etmem için sıra sıra 30 gün boyunca recursive tahmin yapmam lazım. Böyle bir şey yapmıyoruz.
Onun yerine bugünkü fiyata bakıyor ve başka finansal veriler düşünüyoruz. Aylık finansal veriler. bir ay sonrası, bir sene sonrası için tahmin yapmamızı sağlıyor. Öte yandan dil tam anlamıyla ardışık.
Büyük dil modellerini düşünün. Sırayla sonraki kelimeleri, sonraki cümleleri yaratıyorlar. Her yaratılan öğe öncekilere bağlı. Zaten basit bir cümlenin yapısını düşündüğümüzde kabak gibi belli oluyor mu?
Yani dil modellerini filan bırakın, kendi konuşmamıza bakın. Ben şimdi yaptığım gibi cümleye özneyle başlamışsam ağın bunu bir müddet hatırlaması ve sonraki kelimeleri seçerken kullanması, zamanı gelince de unutması lazım. Bakın, deminki cümleyi tekrar dinlerseniz, baştaki ben, yaptığım ve başlamışsam kelimelerini etkiledi. Fakat bir noktada özne değiştiği için onun ertesinde gelen hatırlaması, kullanması, unutması gibi fiiller ben tarafından etkilenmediler.
Bu ilişkiler cümle içiyle sınırlı değil. Bir paragrafın başındaki cümle en son cümleyi etkileyebiliyor. Yahut bir kitabın ta en başındaki bir diyalog sonunda olan bitenler ışığında bambaşka bir anlam kazanabiliyor. Bunu sinir anında nasıl yapabiliriz?
Nöronlar çıktılarını bir sonraki katmana iletirken aynı zamanda önceki katmanlara. veya kendilerine geri iletmeliler. Sonuçta bir şekilde o hesaplar dümdüz ilerleyip sistemden çıkmak yerine en azından bir kopyası sistemin bir tarafında kalırsa sonraki hesapları etkileyebilirler. Mimariye böyle hafıza kazandırılıyor ve böyle yapılara da Recurrent Neural Network deniyor.
RNN. Peki bu muydu derdimize devam? Ne yazık ki RNN'ler de eskiler. 50 senedir ortalıktalar.
Yani Google'ın Ta 2016'ya kadar bunlara geçmemesinin ardında başka nedenler var. Kronik bir takım sorunları var, onları çözen bir yenilik olması gerekecekti. Anca öyle geçtiler. Ve işin komik yanı da ne biliyor musunuz?
Bugün o mimariyi de kullanmıyorlar. Zira tam o geçişi yaptıkları sene meşhur bir makale yayınlandı. O sırada meşhur değildi yani sonradan meşhur oldu. Attention is all you need isimli.
Sadece 3 sene içinde Google Translate sinir ağı yapısını o yönde bir kez daha değiştirecekti. Siz tabi bu yeni yapıyı başka bir yerden tanıyorsunuzdur. Zira GPT, Cloud, Bard, Gemini, Lama gibi büyük dil modellerinin temeli yani devrimin son ayağı. Şimdi bugünlük duralım artık, biraz soluklanalım.
Orijinal olarak ben bunu tek bölüm halinde hazırlamıştım da, sonuna kadar gidecektik. Ama artık tarih yolculuğumuzun sonuna geldik. Bundan sonrası biraz daha teknik. Son birkaç senedeki gelişmelere odaklanacağım.
O yüzden uygun bir noktadayız ara vermek için. Gelecek bölüme bu hafıza sahibi ağlarla başlayacağız. Nasıl sorunları vardı ki millet 50 sene boyunca onları doğru düzgün kullanmamış ve o sorunlar nasıl aşılmış? Sonra embedding denen çok temel ve çok önemli bir teknik var.
Bunu öğreneceğiz. Ondan sonra da konunun kalbi olan attention planning. kavramına geleceğiz. Artık o noktada GPT mimarisini baştan aşağı anlayabilecek seviyede olacağız.
Ondan da ileri gitmek istemiyorum şimdilik. Mesela Sora gibi metinden video yaratma sürecine atlayabiliriz. Çok istek gelirse yaparım bilmiyorum. Fakat seriyi teknik bir bölümle değil de daha felsefi bir bakışla bitirmek Bu sistemlerin yaptığı şeye düşünme denebilir mi?
Dünyayı anlıyorlar mı? Genel yapay zekaya gidiş yolu bu modeller midir? Ne kadarı abartı? İşin içindeki uzmanların gayet güncel tartışmaları var.
Her hafta bir tanesi çıkıyor. Onlar da bölünmüş durumdalar. Onlara da bir dokunup bitiririz diyorum. Evet dostlar, Romalılar ve araya karışmış tüm yapay zekalar.
Benim adım Hıdır, planım budur. Hepinize dinlediğiniz için çok teşekkür ederim. Bu podcast'inde hiçbir kısmı GPT tarafından yazılmadı, seslendirilmedi. %100 elemeği, çene nuru, Patronlar size de ekstra teşekkürler.
Özellikle de Can Çilingir, Mehmet Erdoğan, Ümit Karayakalı, Taylan Bilal, Haşim Solmaz, Serbest Kitaplar, Sabahdeniz Gülensoy, Selim Sanje, İhsan ve Meryem Bayraktar. Çok geçmeden, bu sefer hakikaten çok geçmeden, hepinizle tekrar görüşmek üzere.
Bu transkript otomatik olarak oluşturulmuştur; küçük hatalar içerebilir.