Skip to content
Metne geç

Sağırların Öncülüğünde Yapay Zeka Yönetişimi

Demo Kanıt Değildir: Google DeepMind'ın İşaret Dili Yapay Zekasının Bundan Sonra Kanıtlaması Gerekenler

PDF indir
Sesli İçgörüler
Şuradan da dinleyin Spotify

12 Ağustos'ta Google DeepMind, çok dilli bir işaret dilinden metne modeli olan SL2T'yi duyurdu ve Pixel 11'de Gboard ve Live Transcribe aracılığıyla tüketici ürünlerinde sunmaya başladı. İlk sürüm Amerikan İşaret Dilini (ASL) İngilizceye çeviriyor; ek cihazlar ve işaret dilleri planlanıyor. DeepMind, temel modelin 50'den fazla işaret dilini kapsayan 100.000 saatten fazla veriyle eğitildiğini bildiriyor. Her ölçüye göre bu, işaret dili yapay zekasını önemli bir çizginin ötesine taşıyor: araştırma laboratuvarından çıkıp sıradan insanların cebinde taşıyacağı bir ürüne dönüşüyor.

Bu geçiş önemli, ancak olmadığı bir şeyle karıştırılmamalı. Teknolojik bir atılım ile doğrulanmış bir dağıtım farklı şeylerdir ve söz konusu teknoloji tarihsel olarak marjinalleştirilmiş bir dil topluluğunun kullandığı doğal bir dili işlediğinde bu ayrım son derece önem kazanır. SL2T'nin şimdi ortaya koyduğu soru, modelin bir gösterimde işleyip işlemediği değildir. Soru, arkasındaki kanıtların dağıtımın üzerine bindireceği yükü taşıyıp taşıyamayacağıdır.

Hakkını teslim etmek gerekir

Bu sürüm, bir teknoloji şirketinin Deaf katılımı olmadan Deaf insanlar için bir şey inşa etmesine dair tanıdık hikayeye indirgenmemelidir. Google DeepMind'a göre, Deaf insanlar projenin kavramsallaştırılmasından veri toplanmasına, kullanıcı çalışmalarından etki değerlendirmesine kadar süreç boyunca dahil edildi. Şirket ayrıca üyeleri arasında National Association of the Deaf, Rochester Institute of Technology'nin National Technical Institute for the Deaf'ı, Deaf Professional Arts Network ve World Federation of the Deaf ile bağlantılı temsilcilerin bulunduğu bir AI Sign Language Advisory Committee (AISLAC) kurdu. Sürümle birlikte DeepMind ve AISLAC ortak bir etki raporu yayımladı.

Rapor, işaret dili yapay zekasında hâlâ nadir görülen bir şeyi yapıyor: sistemin nerede kullanılmaması gerektiğini belirtiyor. SL2T 1.0 açıkça düşük riskli bir yardımcı giriş aracı olarak tanımlanıyor. Sağlık hizmetleri, hukuki işlemler, eğitim, istihdam kararları, devlet yardımı belirlemeleri veya diğer yüksek riskli ortamlar için tasarlanmamış ya da doğrulanmamıştır ve rapor, teknolojinin nitelikli tercümanların yerini almaması veya kuruluşların erişilebilirlik yükümlülüklerinden kaçınmasının bir yolu olarak hizmet etmemesi gerektiğini açıkça belirtiyor. Bu, yönetişimdir ve takdiri hak ediyor. Ancak bu, yönetişimin sadece başlangıcıdır.

Bir kıyaslama testi bir kanıttır, kanıt tabanının kendisi değildir

DeepMind güçlü bir performans bildiriyor. FLEURS-ASL üzerinde SL2T, daha önce bildirilen herhangi bir sonuçtan daha yüksek olan sıfır atışlı (zero-shot) 70 BLEURT puanına ulaştığını bildiriyor; ayrıca PRESTO-ASL (tek elle yapılan bir FLEURS-ASL varyantı) ve FSboard parmak harfleme verileri üzerinde ek değerlendirmeler yapıldı. Şirket ayrıca Deaf Googler'larla yayın öncesi testler, Deaf katılımcılarla harici bir günlük çalışması ve Kuzey Amerika AISLAC üyeleri tarafından uygulamalı değerlendirme gerçekleştirdi. Bunlar anlamlı kanıt biçimleridir ve hiçbiri hafife alınmamalıdır.

Ancak yapay zeka hakkındaki kamuoyu tartışmasının belirsizleştiği nokta tam olarak burasıdır, çünkü kanıtlanmış performans kapsamlı doğrulamayla aynı şey değildir. Bir model, seçilmiş kıyaslama testlerinde etkileyici performans gösterirken popülasyonlar, ortamlar, dil çeşitleri, işaretleme stilleri, cihazlar ve kullanım durumları arasında ciddi zayıflıklar taşımaya devam edebilir. DeepMind'ın kendi raporu da bunu kabul ediyor. Model, dilbilgisel karmaşıklık, manuel olmayan işaretler, bölgesel işaretler, çok anlamlı işaretler, parmak harfleme, özel isimler, sıra dışı kamera konumlandırması, düşük ışık, argo ve daha uzun konuşma bağlamıyla zorlanabiliyor. Ayrıca hatalı bir şekilde "hayalet metin" üretebiliyor ya da işaretleyen kişi bir ifadeyi bitirmeden önce tahmini bir tahmine bağlanabiliyor.

Bunlar önemsiz uç durumlar değildir. Yüz ifadesi, baş hareketi, uzamsal yapı, sınıflandırıcılar, bölgesel farklılık ve söylem bağlamı, işaret dilinin süslemeleri değildir. Onlar dilin kendisidir. Sözlük biçimindeki kelime dağarcığını iyi işleyip yüzde ve işaretleme alanında taşınan dilbilgisinde sendeleyen bir sistem, işaret dili çevirisini çözmüş değildir; sadece bir kısmını çözmüştür ve çözülmeden kalan kısım işaret dili kullanan insanlar arasında eşitsiz bir şekilde dağılmaktadır.

Bir sonraki soru ayrıştırmadır

Bu eşitsizlik, tam olarak kanıtın bir sonraki aşamasının neden önemli olduğunu gösteriyor. DeepMind, kıyaslama testi performansının yaş, cinsiyet, etnik köken, bölge, sosyolekt ve Black ASL dahil olmak üzere değişkenler arasında henüz tam olarak ayrıştırılmadığını kabul ediyor. Rapor ayrıca motor engelli veya sıra dışı hareket kalıplarına sahip işaretleyicileri içeren resmi değerlendirmenin sınırlı kaldığını ve modelin 18 yaşın altındaki çocuklar üzerinde ne eğitilmediğini ne de resmi olarak değerlendirilmediğini belirtiyor.

Toplu bir performans rakamı, sistemin Black ASL kullanan işaretleyicilere diğerlerine hizmet ettiği kadar iyi hizmet edip etmediğini, oldukça bölgesel işaretlemeyi nasıl ele aldığını veya doğruluğun yaş grupları arasında nasıl değiştiğini bize söyleyemez. Uzuv farklılıkları, tremor, serebral palsi, artrit veya hareketi şekillendiren diğer durumlara sahip insanlar için modelin nasıl performans gösterdiğini ya da doğruluğun kamera açısına, ışıklandırmaya, cilt kontrastına, işaretleme hızına, işaretleme alanına veya cihaza göre değişip değişmediğini söyleyemez. Sadece bir ifadeyi yeniden kelimelere döken hatalarla anlamını değiştiren hataları birbirinden ayırt edemez. Ve bunların hepsinin altında yatan soruyu yanıtlayamaz: hangi düzeydeki hatanın kabul edilebilir olduğuna ve kimin için olduğuna kim karar veriyor. Bu son soru, ne kadar yetenekli olursa olsun bir mühendislik ekibi tarafından çözülemez.

Katılım bağımsız doğrulama değildir

Daha ileri bir ayrım özen gerektiriyor. AISLAC anlamlı bir yönetişim mekanizmasıdır; Deaf kurumsal katılımı, kullanıcı çalışmaları ve ortak etki değerlendirmesinin hepsi önemlidir. Ancak danışma katılımı ile bağımsız teknik değerlendirme farklı işlevler görür. Yayımlanan kanıtlar şu anda geliştirici tarafından yürütülen değerlendirmelerden, projenin kendi yönetişim yapısı içinde bir araya getirilen kullanıcıları ve danışmanları içeren testlerden ve Google DeepMind ile AISLAC katılımcıları tarafından ortaklaşa yazılan bir raporundan oluşuyor. Bu gerçek bir kanıt tabanıdır ve bağımsız bir tekrarlama değildir.

İşaret dili yapay zekası olgunlaştıkça, alan olgunlaşan her bilimsel alanın beklediği şeyi beklemelidir: iddiaları bağımsız olarak test edebilen, mümkün olduğunda değerlendirmeleri tekrarlayabilen, alt grup performansını inceleyebilen, düşmanca koşulları araştırabilen ve dağıtımdan sonra gerçek dünya davranışını çalışabilen harici araştırmacılar. Erişilebilirlik teknolojisi, amaçlanan amacı faydalı olduğu için daha düşük bir kanıt standardına tabi tutulmamalıdır. Hatta hizmet ettiği nüfusun cevaba daha fazla bel bağladığı bile söylenebilir.

En zor yönetişim sorunu lansmandan sonra ortaya çıkar

DeepMind ve AISLAC, kurumsal kötüye kullanımı açıkça kritik bir risk olarak tanımlıyor ve bu değerlendirme herhangi bir kıyaslama puanından daha önemli çıkabilir. Ucuz bir otomatik iletişim teknolojisi var olduğunda, okullar, hastaneler, işverenler, devlet kurumları, mahkemeler ve işletmeler onu amaçlanan kapsamının ötesinde kullanmak için güçlü bir ekonomik teşvikle karşı karşıya kalır. Kahve sipariş etmek için tasarlanmış bir ürün, birinin acil serviste başvurduğu bir ürüne dönüşür. Metin mesajları taslağı hazırlamak için inşa edilmiş bir araç, bir işverenin artık bir tercümana ihtiyaç olmadığı sonucuna varmasının nedeni haline gelir. Bir kolaylık özelliği, sessizce altyapıya dönüşür.

DeepMind'ın raporu bu kaymayı öngörüyor ve tercüman yerine geçmeyi kesinlikle reddediyor. Açık soru, bu sınırın satın alma süreçleri, bütçeleme, ürün genişlemesi ve bir yöneticinin daha ucuz otomatik seçeneğin yeterince iyi olup olmadığını sorduğu kaçınılmaz an ile karşılaşmayı atlatıp atlatamayacağıdır. Belirtilmiş sınırlar gereklidir. Uygulanan sınırlar ise gerçekten önemli olandır.

Yapay zeka yönetişimi genel olarak da aynı alana yöneliyor. Merkezi sorular giderek daha az bir sistemin bir görevi yerine getirip getiremeyeceğiyle, daha çok kimin onu kontrol ettiği, performansının nasıl değerlendirildiği, ne tür bir izlemenin var olduğu, beklenmedik şekilde davrandığında ne olacağı ve kimin hesap verebilir kalacağıyla ilgilidir. Bu ayın başında, ABD Temsilciler Meclisi'nden Demokratlar OpenAI ve Anthropic'e baskı yaptı ve yapay zeka ajanlarının test ortamlarından kaçıp harici sistemlere ulaşmasının ardından sistemlerin nasıl izlendiğini, hangi güvenlik kontrollerinin bulunduğunu ve bağımsız denetimlerin zorunlu kılınıp kılınmaması gerektiğini sordular. Teknolojiler farklıdır; yönetişim ilkesi farklı değildir. Yetenek, gözetim ihtiyacını azaltmaz. Onu artırır.

Bundan sonrası

Google, SL2T'nin ASL'yi çevirebildiğine dair kanıt üretti bile. Daha zor sorular yetenekten değil dağıtımdan kaynaklanıyor: performansın bağımsız olarak tekrarlanıp tekrarlanamayacağı; doğruluğun demografik, dilsel, coğrafi ve engellilik grupları arasında nasıl değiştiği; gerçek dünya hata oranlarının ne olduğu ve hangi hataların kelime seçiminden çok anlamı değiştirdiği; kullanıcıların modelin ne zaman belirsiz olduğunu nasıl bilecekleri ve model yanlış olduğunda zararların nasıl bildirileceği; harici araştırmacıların sistemi anlamlı bir şekilde değerlendirmek için yeterli erişime sahip olup olmayacağı; ve topluluk yönetişiminin, kurumsal alıcıların Google'ın çizdiği sınırları aştığı zamanlar da dahil olmak üzere, ürün küresel olarak ölçeklenirken gerçek bir etkiye sahip olmaya devam edip etmeyeceği ve bu sınırların iki üç ürün nesli sonrasında da görünür kalması gerektiği zaman ne olacağı.

Bir gösterim, bir sistemin ne yapabildiğini gösterir. Bir kıyaslama testi, bunu ne kadar iyi yaptığı hakkında bir şey söyler. Bir kullanıcı çalışması, insanların onu nasıl deneyimlediğini yakalar ve bir yönetişim yapısı kimin söz sahibi olduğunu kaydeder. Bunların hiçbiri tek başına bir tüketici dağıtımının ortaya koyduğu her soruyu yanıtlamaz; bu, zaman içinde inşa edilmiş ve dışarıdakilere açık bir kanıt ekosistemi gerektirir.

SL2T, tüketici işaret dili yapay zekasındaki şimdiye kadarki en önemli gelişme olabilir ve Google, ciddi ilgiyi hak eden yönetişim adımları attı: Deaf katılımı, açık dağıtım sınırları, sınırlamaların kamuya açık şekilde ifşa edilmesi ve tercüman yerine geçmeyi reddettiğini belirtmesi. Uygun tepki ne kutlama ne de reddir. Bu, incelemedir, çünkü işaret dili yapay zekası araştırma laboratuvarından birinin cebine taşındığında standart değişir. Artık demo yeterli değildir. Şimdi kanıtın onu takip etmesi gerekiyor.

Novara Consulting Group'a abone olun

Yeni gönderiler gelen kutunuza gelsin.

Consult