AI Systems Matters'in Nedeni Şimdi Daha Fazlasını Veriyor
Yapay zeka artık bir laboratuvar merakı değildir. Kredi uygulamaları, tıbbi tedavileri, otonom araçları kontrol eder ve online içeriği gösterir. Bu kararlardan her biri, ipotekleri sadece nitelikli adaylara inkar edebilir. Kötü bir doğrulama tıbbi AI, güvenli olmayan bir araç, çarpışmalara neden olabilir. Doğrulama, vaat eden bir model ile güvenilir bir dağıtım arasındaki boşluğu köprüler.
Riskler özellikle yüksek çünkü AI sistemleri öngörülebilir şekillerde başarısız değildir. Geleneksel yazılım böcekleri kazalara veya yanlış çıktılara neden olur. Bir AI sistemi, nadir kenar vakalarında başarısız olurken görünüşte doğru çıktılar üretebilir.Bu, sistemin sadece sistemin ne yapması gerektiğini kontrol etmek zorunda değildir, ancak aynı zamanda geliştiricilerin asla hayal kırıklığına uğratmadığı durumlarda zararlı şeyler yapamaz.
Dünyadaki düzenlemeler fark ediliyor. Avrupa Birliği ’ AI Yasası, doğru doğrulama yüz yasal yükümlülüğü, yüksek riskli sistemler için uygun değerlendirmeler yoluyla uygulamaları sınıflandırıyor. Amerika Birleşik Devletleri'nde, Ulusal Standartlar ve Teknoloji Enstitüsü (NIST) devam eden bir AI Risk Yönetimi Çerçevesi yayınladı.
Temel Yaklaşımlar Doğrulama
Data Denetim: Kaynakta Bias'ı bulmak
Açıklama ve #8220;garbage in, çöp out” özellikle tarihsel eşitsizlikleri yansıtan AI. Eğitim verileri, bu eşitsizlikleri modele öğretecektir. Data denetimleme, ilk savunma hattıdır.
Ortak denetim teknikleri şunları içerir:
- [FONT:0]Demografik parite analizi:) Hassas özelliklerin (race, cinsiyet, yaş) veri kümesine bile dağıtıldığı kontrol ediliyor.
- [FONT:0)Disparate etkisi ölçümü: Gruplar arasında olumlu sonuçlar elde etmek. ABD Eşit İstihdam Fırsat Komisyonu, işe alımda olumsuz etki için% 80 kural olarak kullanır.
- [FONT:0)Proxy değişken algılama:[Döneticileri güçlü bir şekilde tanımlayan özellikleri tanımlamak, örneğin ZIP kodu yarışla korelasyon. hassas özellikler modelden dışlanmış olsa bile, proxyler yeniden başlatılabilir.
- [FONT:0)Label kalite kontrolleri:[Dönetici:[Dönetici:0))Ensuring that zemin-gerçek etiketler tutarlı ve boş annotatör önyargısı. Örneğin, tıbbi görüntülemede radyologlar aynı taramayı yorgunluk veya ikrat önyargıya göre etiketleyebilir.
NIST’s.FLT:0)AI Bias Kaynakları[[Dönetici: 1) denetim teknikleri ve adillik ölçümleri üzerinde ayrıntılı rehberlik sağlar. Ancak, denetimleme bir zaman çizelgesi değildir. Data dağıtımları zaman içinde değişir, bu yüzden sürekli izleme gereklidir.
Test ve Geçerlilik: İşsizleştirmeden Önce Stresli Modeller
Bir model eğitilmiş olduğunda, geniş bir dizi senaryoya karşı test edilmelidir.Bir toplantıda standart geçerlilik yetersizdir, çünkü sadece önyargı ve güvenlik için test etmek, zorlu girdilerin kasıtlı inşaatı gerektirir.
[FONT:0]Scenario tabanlı test[Dönetici:0] [Dönetici:0]Scenario bazlı test[Dönetici:0] [Dönemli bir test için [Dönetici:0], karanlık kıyafetlerde yayalar, aniden hava değişiklikleri ve inşaat bölgelerinde test vakaları, gerçek dünya karmaşıklıkları ile ilgili boşlukları nasıl ele alabilir.
[[Dönetici testi[[[Dönetici:0)Stres testi[[[Dönetici:0))) Modeli ve #8217; küçük, semantically önemsiz perturbasyona yanıt olarak, bu, görünmez davranışlar için gürültüyü ve potansiyelini gösterir.
[[Dönetici testleri[[Dönetici:0)[Dönetici:0)[Dönetici testleri [Döneticileri) bir adım daha ileri gider. Bu, özellikle güvenlik-kırık uygulamalar için kritiktir. Google’surFLT:2).Adversarial Robustness Toolkit).
Geçerlilik ayrıca, 0:0) insan-in-the-loop değerlendirme[Dönetici: 1 ) dahil olmak üzere otomatik ölçümler her başarısızlık modunda yakalamamalıdır. Domain uzmanları, son kullanıcılar ve etkilenen topluluklar, metriklerin kaçırıldığı sorunları tanımlayabilir. Örneğin, bir sohbetbot tüm otomatik florency testlerini geçebilir, ancak yine de bu davaları yakalamak için saldırgan cevaplar üretebilir.
Formal Verification: Güvenlik Mateematical Garantileri
Formal doğrulama, bir AI sisteminin tüm koşullar altında istenen özellikleri ispatlamak için titiz matematiksel bir neden geçerlidir. Bu, altın standart gibi geliyor, ancak önemli ticaretle geliyor.
Lineer sınıflandırıcılar veya karar ağaçları gibi basit modeller için, resmi doğrulama nispeten basit. Modelin davranışı bir kısıtlama olarak ifade edilebilir ve bir çözücü herhangi bir ihlalin olup olmadığını belirleyebilir. Derin sinir ağları için, problem çok daha zor hale gelir.
Teknikler:0)Satisfiability Modulo Theories (SMT) çözücüler ) ve [[Dönetici:2|seçmiş-integer lineer programlama (MILP)), sinir ağları hakkında başarılı bir şekilde doğrulanmış özellikler için uygun hale getirildi. #8220; Bu aralıktaki tüm girişler için, çıkış sınıflandırması değişmeyecek ve #8221; veya & #8220; ağ asla bir adversarial örneği için yüksek bir güven puanı atamayacaktır.
[FONT:0]AlphaBeta-CROWN) çerçevesi, sinir ağları için önde gelen resmi doğrulama araçlarından biridir. Üretim büyüklüğüne ölçeklendirmek zor olsa da, üretim hacmine göre, daha büyük modeller için en pratiktir.
Açıklanabilirlik ve yorumlanabilirlik: Siyah Kutuyu Açın
Doğrulama, bir modelin kararlarına nasıl ulaştığını anladığınızda daha kolaydır.Alantı teknikleri, insan incelemelerine şeffaf bir şekilde AI sistemlerinin iç mantığını sağlamak için şeffaf hale getirir.Bu doğrudan güvenlik ispatlamıyor, ancak insan denetçilerinin kusurlu bir neden belirlemelerini sağlar.
Post-hoc Açıklama Yöntemleri
Bu yöntemler, siyah-box modelinin gerçekten sonra ne yaptığını anlatıyor. Popüler teknikler şunları içerir:
- [FONT:0)LIME (Local Interpretable Model-agnostic Explanations):), Perturbs girişleri ve her tahmin etrafında basit bir gerçekrogate modeli nasıl inşa edeceğini gözlemler.
- [FONT=0)SHAP (SHapley Katkıları Ekleniyor):) Her bir özelliği belirli bir çıkış için bir katkı puanına sahip olmak için oyun teorisini kullanın.
- [FONT-CAM (Gradient-weighted Sınıf Aktivasyonu Mapping):) Görme modelleri için, görüntünün hangi bölgelerinin tahmini etkilediği ortaya çıkıyor.
Bu yöntemler mükemmel değildir. Farklı açıklama teknikleri aynı fikirde olmayabilir ve faksaj girişleri tarafından kandırılabilirler. Ancak, doğrulama sırasında değerli tanı araçları olarak hizmet ederler.Eğer bir model bayrakları yüksek risk olarak kredi başvurusu yapar ve SHAP birincil sürücünün başvuru sahibi olduğunu ortaya koyar ve#8217; ZIP kodu, bu önyargı için kırmızı bayraktır.
Inherential Interpretable Models
Alternatif bir yaklaşım, kredi puanlama veya recidivizm tahmin gibi tüm modelleri kullanarak siyah kutulardan kaçınmaktır. Karar ağaçları, sparse lineer modeller ve genelleştirilmiş katkı modelleri (GAMs) doğrudan insanlar tarafından anlaşılabilmektedir. Birçok yüksek ücretli uygulama için kredi puanlama veya recidivizm tahmin gibi uygulamalar için, bu basit modeller tam şeffaflık sunarken rekabetçi doğruluk elde edebilir.
Karmaşık bir kara kutu modeli ile post-hoc açıklamaları ve doğal olarak yorumlanabilir bir model arasındaki seçim temel bir ticaret-off içerir. Güvenlik ve adillik önemli olduğunda, birçok düzenleyici ve uygulayıcılar daha basit, kanıtlanabilir modellera doğru eğilir.
Gelişen teknikler ve kesim Edge
Fairness-Aware Algorithms
Farklı gruplar arasındaki eşitsizlikleri doğrularken, önyargılı algoritmaları doğrudan eğitim sürecine sokmaktadır. Bu algoritmaları korumalı gruplar arasındaki eşitsizlikleri optimize ederken doğruluk için optimize eder. Yaklaşımlar şunları içerir:
- [FONT:0)Öyle işlem: [Dön işleme: [Dönetici: [Dön işleme: [Dön işleme: [Dön işleme: [Dön işleme: [Dönetici: [Dönetici: [Dönetici: 0,4] Eğitimden önce önyargılı korelasyonları ortadan kaldırmak için eğitim verilerinin geri çekilmesi veya sentetik verileri dengeleme gruplarına hazırlamak.
- [FONT:0]In-processing:[Dönetici:[Dönetici:[Dönetici:)) Eğitim sırasında doğruluk ve adalet arasında ticaret yapmayı öğrenir.
- [FONT:0)Post-processing:[Dönetici:[Dönetici: 0,2|Dönetici:0) Model ve #8217'yi ayarlamak; gruplardaki yanlış pozitif oranları eşitlemek gibi eğitimden sonra çıktılar.
Her yaklaşım kör noktalara sahiptir. Pre-processing genel doğruluk azaltabilir çünkü veri dağıtımını değiştirir.In-processing, hangi adilliği optimize etmek için hangi adil bir tanımlamayı gerektirir, bu da bir değer işleme kararıdır. Post-processing dağıtım değişimi altında yeniden ortaya çıkabilir. Kapsamlı bir doğrulama yaklaşımı tüm üç kullanır.
Adversarial Verification
Reklamcılık testlerinde inşa etmek, doğrulama sürekli bir oyuna dönüşebilir. Bir sistem (öncü) hedef modelinin başarısız olmasına neden olan girişleri bulmaya çalışır. Hedef model o başarısızlıklara karşı direnmeye devam eder ve bu işlem bazen rakipsiz eğitim olarak adlandırılır.
Zorluklar kendi hesaplama kaynakları ile sınırlıdır. kararlı bir gerçek dünya saldırganı, yanlışlıkla özlenen iddia edilen iddia edilen iddia edilen iddia edilen iddia edilen hataların düzeltilmesini sağlayabilir.Bu nedenle, güvenlik için barı yükseltmesi olarak görülmelidir.
AI Verification'de Zorluklar ve Sınırlar
Tanım Problemi
Bir AI sisteminin adil veya güvenli olduğunu doğrulamak için, öncelikle adil ve güvenlik ne anlama geldiğinin açık bir tanımına ihtiyacımız var. Ne yazık ki, bu kavramlar oldukça bağlamsaldır. Fairness fırsat eşitliği olarak yorumlanabilir, demografik parite veya bireysel adalet.
Güvenlik aynı şekilde belirsizdir. Özerk bir araç ve#8220; güvenlik ve #8221; eğer bir çarpışmaya asla sebep olmazsa veya sadece insan sürücüsünden daha az çarpışmaya neden olur? Doğrulama tekniklerinin ciddiyetini nasıl ölçebiliriz?
Scalability and Cost
Derin sinir ağlarının formal doğrulaması hesaplamalı olarak pahalı kalır. 10.000 nöron ile model için çalışan araçlar 100 milyon parametre ile modellerde çalıştırmak için günler veya hafta sürebilir. Kapsamlı senaryo testleri gibi daha basit yöntemler büyük hesaplama bütçeleri ve insan gözetim gerektirir.
Yeni başlayanlar ve daha küçük şirketler için, kapsamlı doğrulama maliyeti yasaklanabilir. Bu, daha fazla kaynağa sahip daha güvenli AI'yı karşılayabilir, potansiyel olarak iyi hazırlanmış sistemler ve üretim yollarını bulabileceklerdir.
Black Swan Problemi
Doğrulama doğal olarak geriye dönükdür. Sistem bilinen başarısızlık modlarına karşı kontrol eder ve tanımlanmış özellikler tanımlayamaz. Sistemden ve #8217'den ortaya çıkan tamamen yeni başarısızlık türlerini öngöremez; vahşi bir AI sistemi tüm bilinen önyargı senaryolarında iyice test edilebilir, ancak yine de farklı bir kültürel bağlamda dağıtılan yeni önyargılar geliştirir.
Bu, doğrulamanın bir zaman sertifikasyonu olmadığı anlamına gelir. Bu, devam eden bir izleme süreci, yeniden değerlendirme süreci ve güncelleme. Dağıtımda doğrulanan sistemler yeni veriler veya çevre değişiklikleri öğrendikleri gibi uyumdan uzaklaşabilir.
Düzenleme ve Standartlar
Hükümetler ve standartlar doğrulama gerekliliklerini yerine getirmek için hareket ediyor. [Ücretsiz AI Yasası) Yüksek riskli AI sistemlerinin önyargı denetimleri, belge ve insan gözetimi içeren bir uygunluk değerlendirmesine sahip olması durumunda, davranış adil olmayanlık ve güvenlik için test gerektirir.
Birleşik Krallık'ta, Veri Etik ve İnovasyon Merkezi, algoritma şeffaflığı üzerine kılavuzlar yayınladı. Çin'de Bilim ve Teknoloji Bakanlığı, ISO/IEC 42001 (AI management sistemleri) ve IEEE’) gibi uluslararası standartları adilleştirmek için bir e-posta paketi yayınladı.
Bu düzenlemeler ve standartlar ortak ilkeleri paylaşır: şeffaflık, hesaplama ve sürekli izleme. Ayrıca doğrulamanın tek boyutlu bir etkinlik olmadığını da kabul ederler. rigor gerekli uygulama seviyesine bağlıdır.
Organizasyonlar için Pratik Tavsiyeler
Tek doğrulama tekniği kendi başına yeterli değildir. Güçlü bir program, katmanların birden çok yöntemi birleştirir:
- [FONT:0) Erken başla.[[DÜDÜT:1) Verification, projenin başlangıcından itibaren veri denetim ve adil kontrolleri içermemelidir.
- [FONT:0)Komün risk senaryoları[Döneticiler ile], AI sisteminiz için en kötü durum başarısızlık modlarını listeler.Bu senaryoları test etmek için kullanın.
- [FONT:0] Çeşitli test setleri inşa edin.[[Döneticileri, kenar vakaları ve faksiyetli girişler.Involve domain uzmanlar ve etkilenen topluluklar.
- [FONT:0] Hem otomatik hem de insan değerlendirmelerini kullanın.[DÜT:1] Otomatik ölçümler istatistiksel anomalileri yakalar; insan incelemecileri bağlama bağlı hataları yakalar.
- [FONT:0] Sürekli izleme[Dönetici:0]Deiş pangrupları takip eden iş panoları ve performans zamanla sürüklenir.
- [FONT:0] Her şeyi saklı tutar.[DÜDÜT:1] doğrulama faaliyetleri, bulguları ve remediasyonlar kaydınızı korur. Bu, düzenleyici uyumluluk için ve kurumsal bilgi oluşturmak için gereklidir.
- [FONT:0) Bu duruma hazır olun.[[Dönetici:0) Verification, her bir sistemi ve testlerini geliştirmek için bir fırsat olarak bulur.
Yol Ahead
AI doğrulama hızla gelişmekte olan bir alandır. Resmi doğrulamadaki araştırmalar, daha büyük modellere ölçeklendirmeye yönelik ilerlemektedir. Mekanik yorumlanabilirlik amacı gibi, sinir ağlarının iç kotalarını tersine çevirmek, davranışlarını daha derin bir anlayış sunmaktır. Federated approach allows multiple organization to share verify rates without exposed entities.
Aynı zamanda, jeneratif AI ve büyük dil modellerinin gelişimi yeni zorluklar getiriyor. Bu modeller neredeyse sonsuz bir giriş alanı var ve öngörülemeyen çıktılar üretebilir.Güvenlik ve önyargı için onları sınıflandırma tabanlı tekniklerin ötesine geçmek için gerekli olan yeni yöntemler gerektirir. Araştırmacılar kırmızı-öğrenme, anayasal AI ve çıkış filtreleme gibi teknikleri keşfediyorlar, ancak bunlar hala olgunlaşmamış.
Nihai hedef tüm riskleri ortadan kaldırmak değildir, ancak AI sistemleri şeffaf, sorumlu ve insan değerleri ile uyumlu hale getirmektir. Doğrulama bu görev için temel araçtadır. Bu, alçakgönüllülük, rigor gerektiren bir uygulamadır ve sistem mükemmel olmadığını kabul etmeye isteklidir.Her doğrulanan AI sistemi, insanların ve güvenli bir şekilde hizmet ettiği bir geleceğe doğru bir adımdır.