İnsan-döngüde (human-in-the-loop) denetim adımı, tasarım dokümanlarına genellikle bir kontrol olarak yazılır: makineyi bir insan kontrol ediyor, öyleyse makine denetim altında. Pratikte bu adım ikinci bir iş yaratır. Bu işin adı denetimsel izlemedir, kendi hata oranları vardır ve zamanla kendine özgü biçimde bozulur. Bu yazıda savunduğum şu: otomasyon yanlılığı ve beceri körelmesi yüzünden naif "her şeyi insan kontrol eder" tasarımları, kapsamı iyi çizilmiş otomasyondan da desteksiz manuel çalışmadan da kötü sonuç verir. Buradan üç kural çıkıyor: eskalasyonu kalibre edilmiş belirsizliğe göre yapmak, denetçiye onay düğmesinden fazlasını, yani gerçek bir karar yetkisi vermek ve eskalasyon yolunun dayandığı manuel becerileri bilinçli olarak çalıştırmak. Sonraki bölümlerde bir eskalasyon eşiğini hesaplıyor ve bir denetim dilimi tanımlıyorum. Formaliteye dönmüş bir denetim adımını nasıl tanıyacağınız da orada.
Denetimsel Kontrol Rolleri: Operatör, Denetçi, Karar Verici
"İnsan döngüde" ifadesi aslında üç ayrı işi kapsar. Operatör işi makinenin yardımıyla yapar. Denetçi makinenin çıktısına bakar, kabul eder ya da reddeder. Karar verici, makinenin açıkça karar vermeyip insana bıraktığı vakaları çözer. Hangisini kastettiğini söylemeyen bir tasarım çoğu zaman en zayıfında kalır: elinde ne karar yetkisi ne de operasyon bilgisi olan bir denetçi.
İşlevleri insanlarla makineler arasında paylaştırma konusunda standart başlangıç noktası Fitts'tir (1951). Onun yerleştirdiği alışkanlık bugün de varsayılan düşünme biçimidir: insanların iyi yaptıklarını listele, makinelerin iyi yaptıklarını listele, işleri buna göre dağıt. Zayıf tarafı, paylaştırmayı sabit bir görev listesini bölüştürmek gibi ele almasıdır. Oysa paylaştırma kararı listenin kendisini değiştirir. Otomatikleştirmeden önce süreci anlamanın şart olmasının bir nedeni de bu. Makine sürecin rutin kısmını devraldığında insana kalan kısmı yeni bir iş olarak incelemek gerekir, çünkü artık eski işin birkaç adımı çıkarılmış hâline benzemez.
Parasuraman ve Riley (1997) arıza biçimlerini adlandırmak için bir sözlük sunar. Otomasyon kullanılabilir, aşırı güvenle yanlış kullanılabilir, yersiz güvensizlik yüzünden hiç kullanılmayabilir ya da paylaştırmanın insanlara etkisini hesaba katmayan bir devreye almayla istismar edilebilir. Naif denetim adımı bu son gruba girer. Kimse bir kişinin günde iki bin sınırda kalemi kalem başına üç saniyede sınıflandırmasına karar vermedi.
Otomasyon Yanlılığı ve Rehavet
Otomasyon yanlılığı, otomatik çıktıyı doğru kabul etme ve aksini gösterecek kanıtı yeterince aramama eğilimidir. İki şekilde ortaya çıkar. İhmal hatasında denetçi, otomasyonun işaretlemediği bir durumu gözden kaçırır. İcra hatasında ise önünde çelişen bilgi varken hatalı bir öneriye göre hareket eder. İkincisi daha rahatsız edicidir, çünkü hatayı yakalayacak kanıt oradaydı ve kullanılmadı.
Mekanizmanın dikkatsizlikle pek ilgisi yok. Kahneman'ın (2011) ikame dediği şey işliyor: zor bir soru, daha kolay bir soruyla yer değiştiriyor. "Bu sınıflandırma doğru mu?" sorusunu cevaplamak için vakayı baştan kurmanız gerekir. "Bu, sistemin genelde doğru bildiği şeylere benziyor mu?" sorusu bunu istemez. Zaman baskısı altında ve güvenilir bir sistemle çalışırken bu ikame neredeyse her tek kalemde işe yarar. İnsanlar da onu bu yüzden sistemin yanıldığı az sayıdaki kaleme taşır.
Rehavet aynı etkinin zamana yayılmış hâlidir: uzun süre güvenilir çalışmış bir kanaldan dikkat yavaş yavaş çekilir. Yani tasarımcı denetçinin dikkatini sabit bir değer olarak varsayamaz. Dikkat, sistemin o güne kadar ne kadar güvenilir göründüğüne bağlıdır ve sistem iyileştikçe azalır.
Otomasyonun İronileri ve Artık Görev
Bainbridge (1983) yapısal sorunu şöyle tarif eder: otomasyon işi eşit dilimlere bölüp birini almaz. Kolay, iyi tanımlanmış ve sık görülen vakaları alır, geri kalanını operatöre bırakır. Geriye kalanlar muğlak ya da seyrek vakalardır ve sonuçları sayılarına oranla çok daha ağırdır.
Bundan iki sonuç çıkar. Birincisi, insana kalan görevin zorluğunu geriye kalan vakalara bakarak tahmin edin, ortalama vaka burada yanıltır. Kararların yüzde 95'i otomatikleşirse denetçilere en zor yüzde 5 kalır ve bu, eski bilişsel yükün yüzde 5'iyle aynı şey değildir. İkincisi, insanlar seyrek arızaları izlemekte kötüdür. İzleme rolünü insana veren bir program, paylaştırma geleneğinin insandan uzak tutulmasını söyleyeceği işi ona vermiş olur.
Seyrek Sinyalli Denetimde Tetikte Olma Kaybı
Mackworth'un uzun süreli görsel arama üzerine çalışması (Mackworth, 1948) tetikte olma kaybını ortaya koydu: nöbet ilerledikçe tespit performansı düşer ve sinyaller seyrekse en hızlı düşer. Yüksek doğruluklu bir sistem, denetçisini tam da bu duruma sokar.
Kalem başına sistem hata oranı p, denetçinin tespit oranı d olan N kalemlik bir parti için:
escaped defects = N · p · (1 − d)
reviews per defect = N / (N · p · d) = 1 / (p · d)
İkinci satır maliyeti gösterir. Burada d, p'den bağımsız değildir: p düştükçe denetçinin aradığı sinyaller seyrekleşir ve d de onunla birlikte düşer.
Aşağıdaki tablo varsayılan değerlerle kurulmuş bir örnek hesaptır. Tamamı denetlenen 10.000 kalem varsayar. Tespit oranı yüzde 10 hata oranında 0,80, yüzde 1'de 0,30 alındı. Bu değerleri yapıyı görünür kılmak için seçtim, hiçbiri ölçülmedi.
| Sistem hata oranı | 10.000 kalemdeki kusur | Varsayılan tespit oranı | Kaçan kusur | Yakalanan kusur başına denetim |
|---|---|---|---|---|
| %10 | 1.000 | 0,80 | 200 | 12,5 |
| %1 | 100 | 0,30 | 70 | 333 |
Daha iyi modelle kaçan kusur sayısı yine düşer, düşmesi de gerekir. Çöken şey denetimin verimidir. Aynı emek önceden 12,5 incelemede bir kusur yakalıyordu, şimdi 333 incelemede bir kusur yakalıyor. Bu verimde denetim adımının asıl ürettiği şey, işin kontrol edildiğine dair bir inançtır. Yüzde 99 doğrulukla çalışan bir sistemi denetlemek, yüzde 90'la çalışanı denetlemekten bu yüzden daha zordur.
Otomatik Kararlar İçin Eskalasyon Tasarımı
Her şeyi denetlemenin alternatifi yönlendirmedir. Yönlendirme kuralı da açık bir maliyet karşılaştırmasından çıkmalı. Kulağa sorumlu gelen bir yüzde seçmek yetmez.
Bir koleksiyon kartı üreticisi için kurduğumuz otomatik kalite kontrol pipeline'ında işin kabaca yüzde 95'i, 90'ı aşkın doğrulama kontrol noktası üzerinden otomatik yürüyor. Kalan yüzde 5, kontrol noktalarının verdiği kanıtın muğlak kaldığı vakalardan oluşuyor. Bu vakaları tasarım gereği insana ayırdık: makine işaretliyor, kararı deneyimli bir müfettiş veriyor. Pipeline'dan önce sekiz saat süren manuel kontrol şimdi yaklaşık on beş dakika sürüyor, çünkü müfettiş zamanını yalnızca kendi yargısının sonucu değiştirdiği yerde harcıyor.
Kalibre edilmiş güven eşikleri
Bir güven skoru ancak kalibre edilmişse yönlendirmede kullanılabilir: 0,90 skor alan kalemlerin yüzde 90'a yakını doğru çıkmalı. Kalibre edilmemiş bir skor, kalemleri gerçeğin keyfî bir dönüşümüne göre yönlendirir ve ortaya büyük ama pek bir şey söylemeyen eskalasyon kümeleri çıkar. Kalibrasyonu ayrılmış (held-out) veride, segment segment ölçün ve belli bir takvimle yeniden ölçün, çünkü girdiler kaydıkça kalibrasyon da kayar. Bu yüzden kalibrasyon, devreye alınan her modelin ihtiyaç duyduğu üretimdeki değerlendirme disiplininin bir parçasıdır.
Skorlar kalibre olduktan sonra eşik maliyetlerden çıkar. p(x), x kalemini otonom işlemenin yanlış olma olasılığının tahmini, C_miss bu hatanın maliyeti, C_review de bir insan kararının maliyeti olsun:
escalate if p(x) · C_miss > C_review
i.e. p(x) > C_review / C_miss
Tasarım parametresi bu orandır. Oranı dürüstçe yazabilmek için, kısa üretim serilerinde kalite maliyeti muhasebesinin yaptığı gibi önleme, değerlendirme ve hata maliyetlerini ayrı ayrı hesaplamak gerekir. Bu oranı herhangi bir birimle (para, saat, yeniden işlenen birim, şikâyet) ifade edemeyen bir ekip eşiğini de savunamaz. Elinde, o an mevcut denetim kapasitesini dolduracak şekilde seçilmiş bir eşik kalır.
Uyuşmazlık örneklemesi
Yönlendirmede kullanılabilecek tek sinyal güven değildir. Elinizde iki bağımsız kontrol olduğunu düşünün: bir kural motoru ile bir model, farklı tümevarımsal yanlılıkları olan iki model ya da bir sistemin şimdiki ve önceki sürümü. Bu ikisinin anlaşamadığı kalemlerde zor vakalar, bir güven bandında olduğundan daha yoğun bulunur. Sebebi, uyuşmazlığın kalemin kendisi hakkında bir kanıt olması. Güven skoru ise tek bir tahmin edicinin kendi hakkındaki beyanıdır. Yalnız korelasyonlu hataya dikkat edin. Aynı veriyle eğitilmiş iki sistem aynı hataları yapar ve o durumda anlaşmaları doğru olduklarını göstermez.
Zorunlu denetim dilimleri
Güvene dayalı yönlendirmenin yapısında bir kör nokta vardır. Yüksek güven bölgesine kimse bakmaz, bu yüzden o bölgenin bozulduğunu gösterecek veri de oluşmaz. Otomatik yolun hata oranını yansız biçimde tahmin etmenin tek yolu küçük bir rastgele örneklemdir: otomatik onaylanmış kalemlerden güvene bakılmadan çekilir ve eskalasyonlar kadar dikkatle denetlenir. Bu dilimin bütçesini yeniden işlemeden ayrı tutun, çünkü yaptığı iş ölçümdür. Dilimin bir faydası daha var. Denetçiler sıradan vakaları görmeye devam eder, temel oranlara dair sezgileri kaymaz ve eskalasyonlardaki yargıları da bu sayede sağlam kalır.
Denetim Arayüzü Tasarımı ve Denetçi Becerisinin Korunması
Durum farkındalığının korunması
Endsley (1995) durum farkındalığını üç parçaya ayırır: ilgili unsurları algılamak, bunların birlikte ne anlama geldiğini kavramak ve sonra ne olacağını öngörmek. Bir hüküm ve iki düğme gösteren bir denetim ekranı bunların hiçbirine yardım etmez. Denetçinin önüne kanıtı ayıklanmış bir sonuç koyar ve yukarıda anlattığım ikame en kolay bu koşulda işler.
Pratikte bunun birkaç somut karşılığı var. Hükmü doğuran kanıtı ekranda hükmün yanında gösterin. Sistemin değerlendirdiği alternatifler de görünsün. Tekrarlayan bir arıza tanınabilsin diye kalemin geçmişini ekleyin ve iş akışı izin veriyorsa kanıtı öneriden önce gösterin. Gerisini Nielsen'ın kullanılabilirlik sezgi kuralları karşılar: sistem durumunun görünür olması, gerçek dünyayla örtüşme, hatırlamak yerine tanıma. Adını koymaya değer bir anti-desen var: en ucuz eylemin aynı zamanda en az bilgiyle yapılan eylem olduğu yerleşim. Küçük bir "ayrıntıları gör" bağlantısının yanına konmuş büyük yeşil Onayla düğmesi, denetçiyi kaşe basmaya iter.
Manuel yolun çalıştırılması
Bir eskalasyon yolu, yönlendirdiği kişilerin yetkinliği kadar iyidir ve bu yetkinlik kullanılmadıkça körelir. Müfettişler bir yıl boyunca yalnızca makinenin karara bağladığı vakaları, makinenin yazdığı özetlerle görürse, tasarımın güvendiği beceriler ihtiyaç anına kadar aşınmış olur: ham bir vakayı okumak, alışılmadık bir arıza biçimini fark etmek, sistemin kararını geçersiz kılmak.
Karşı önlemler sıradan şeyler: küçük bir vaka kümesinde dönem dönem tamamen manuel çalışmak, cevabı bilinen tohum vakaları kuyruğa karıştırmak, denetçileri karar verme ile denetim işi arasında döndürmek ve denetçi yetkinliği için yazılı bir yeniden doğrulama aralığı belirlemek. ISO 9001 zaten kuruluşlardan, kalite performansını etkileyen kişilerin yetkinliğini belirlemesini ve sürdürmesini istiyor. Yoğun otomasyonlu bir süreçte bu yetkinlik, pratik yapıldıkça ayakta kalan bir beceridir ve tek seferlik bir yeterlilik belgesiyle korunmaz.
İnsan-Döngüde Denetim İçin Tasarım Kuralları
- Eşiği seçmeden önce maliyet oranını çıkarın. C_review / C_miss hiçbir birimle ifade edilemiyorsa eskalasyon oranını risk yerine denetim kapasitesi belirliyor demektir.
- İnsanın yapabildiği tek şeyin onaylamak olduğu bir adımı asla yayına almayın. Denetçi kalemi değiştirebilmeli, bilgi isteyebilmeli ya da aşağı akıştaki işleyişi değiştiren bir gerekçeyle reddedebilmeli. Bunlar yoksa o adımda kimse yargı kullanmaz, denetçi yalnızca onay vermiş olur.
- Kalem başına hata oranının düşük olduğu yerlerde tam denetim yerine tam otomasyonu ve denetlenen bir örneklemi tercih edin. p düşükken her şeyi denetlemek çok az kusur yakalar ve denetim diliminin ihtiyaç duyduğu dikkati tüketir.
- Denetçiyi de ölçün, yalnızca modeli değil: denetçi ve segment bazında karar bozma oranı, görev başına harcanan süre, tohum vakalardaki tespit oranı. Sıfıra yakın bir bozma oranı ya sistemin neredeyse hiç hata yapmadığını ya da denetimin ritüele dönüştüğünü gösterir. Hangisi olduğunu ancak tohum vakalar söyler.
- Eskalasyon oranını bir kapasite taahhüdü olarak görün. Kuyruk şiştiğinde denetim kalitesi sessizce düşer. Bu yüzden ekibin dikkatle karara bağlayabileceğinden fazla eskalasyon üreten bir eşik, kâğıt üzerinde daha sıkı görünse de kontrolü zayıflatır.
Bu Analizin Sınırları
Bu yazı, yerleşik insan faktörleri bulgularına dayanan bir tasarım savıdır. Ampirik bir çalışma yapmadım. Sayısal örnekteki tespit oranları yapısal bir ilişkiyi göstermek için seçilmiş varsayımlardır ve gerçek bir sistemin bu değerleri verdiğini söylemiyorum. Üç şey ancak yerinde ölçülebilir: belli bir alanda otomasyon yanlılığının ne kadar güçlü olduğu, sinyaller seyrekleştikçe tespit oranının nasıl değiştiği ve mesleki bir becerinin pratik yapılmadığında ne hızla köreldiği. Birinci elden verdiğim rakamlar tek bir üretim ortamındaki tek bir pipeline'dan geliyor, kıyaslama ölçütü olarak okunmamalı. Eşik kuralı C_miss'i tek bir beklenen değer olarak ele alır. Sonuçlar ağır kuyruklu olduğunda ya da operatör dışındaki insanlara düştüğünde bu yetmez. O durumda eşiği kuyruğa bakarak belirlemek gerekir ve bu, buradakinden farklı bir analizdir.
Kaynaklar
- Bainbridge, L. (1983). Ironies of automation.
- Endsley, M. R. (1995). Toward a theory of situation awareness in dynamic systems.
- Fitts, P. M. (1951). Human engineering for an effective air-navigation and traffic-control system.
- Kahneman, D. (2011). Thinking, Fast and Slow.
- Mackworth, N. H. (1948). The breakdown of vigilance during prolonged visual search.
- Nielsen, J. Usability Engineering.
- Parasuraman, R., & Riley, V. (1997). Humans and automation: Use, misuse, disuse, abuse.
- International Organization for Standardization. (2015). ISO 9001: Quality management systems — Requirements.