單元 5:人工智能風險

快速存取人工智能風險簡介 | 自動化決策系統中的偏見 | 人工智能價值對齊 | 自我測試

指導老師:Adam Bradley 教授、 Andre Curtis-Trudel 教授

人工智能風險簡介

先進的人工智能系統為我們生活作出的關鍵決策越來越多。這些決定包括財務方面(我的貸款會被批准嗎?),刑事司法方面(應否讓某犯罪嫌疑人保釋?),健康方面(這張 X 光片是否顯示患有肺癌?),以及大眾傳播方面(應該推廣哪些新聞報道?)。很快,自主人工智能系統可能會直接控制重要的軍事系統,能源電網的關鍵部分和風險的生物技術項目。在執行這些任務時,人工智能系統通常以連人類專家都無法理解或解釋的方式運行。開發這些人工智能系統,並使用它們來執行這些重要任務會帶來一些嚴重的風險。在這個單元中,我們從哲學的角度討論當中最嚴重的風險。

本單元首先為不太熟悉當代人工智能系統的人提供簡略介紹。 然後,它將通過深入研究兩個主題來探討人工智能風險。

1. 自動化偏見:我們如何確保人工智能系統做出的決策是公平的?
2. 價值對齊問題:我們如何確保人工智能系統按照人類價值行事?

AI Risk

人工智能風險概論 

 

學習成果

本部分將使學生具備以下能力: 

  1. 識別人工智能系統和技術的主要種類。 
  2. 解釋當代人工智能系統的典型開發周期。 
  3. 解釋人工智能的一些主要商業、法律、政府、醫療和科學用途。 

 

在最廣泛的層面上,人工智能是設計出系統以求在特定任務——那些由人類執行的話,會被視為需要「智能」的任務——上展現出人類水平表現的項目。隨著第一批數碼電腦的建造,人們對人工智能的興趣在很大程度上始於 20 世紀 50 年代。雖然按照今天的標準來說,這些機器是簡陋的,但研究人員立即意識到它們解決複雜問題的巨大力量。大約 70 年後的今天,人工智能系統在各種任務上表現出人類水平或超越人類水平的表現。 它們可以下象棋,下圍棋,通過律師考試,寫論文,生成圖像,還有更多更多。

 

雖然這些發展是令人興奮的,而且往往是有益的,但它們也給人類帶來了新的挑戰。 如果有人使用人工智能系統傳播政治錯誤信息怎麼辦?如果軍事人工智能決定以平民為目標,或者更糟糕的是,使用核武器怎麼辦?一個超級智能的人工智能能以某種方式控制和奴役人類嗎?這些只是人工智能技術帶來的一些潛在風險。

本單元將幫助你更好地了解這些風險。在這篇文章中,我們討論了人工智能的廣泛使用所帶來的各種具體風險,以及這種使用所帶來的潛在未來風險。你不需要任何人工智能的背景知識來完成這個單元。在本單元的餘下部分中,我們簡要概述了人工智能的相關面向。如果你對人工智能已有深厚認知,你可以跳過此視頻。但如果你是人工智能的新手,它可能會幫助你了解人工智能帶來的潛在風險。在本單元的餘下部分中,我們將更詳細地討論特定的人工智能風險。

1746666469

人工智能技術的基礎知識

在這段視頻中,我們說明了人工智能技術的一些基礎知識,以提供理解人工智能風險所需的背景。

自動化決策系統中的偏見

學習成果 本部分將使學生具備以下能力:
1. 辨識自動化決策系統中偏見的主要來源。
2. 解釋與偏見決策系統相關的一些主要風險。
3. 從道德、法律和認識論多種角度評估應對自動化偏見的不同方法。

Diagram 1-4

簡介自動化決策系統中的偏見

 

自動化偏見是什麼,以及它從何而來? 

自動化決策系統通常由先進的人工智慧技術驅動,現在被用於各種領域的預測:預測性警務技術用於根據個人的再犯風險預測來決定保釋和判刑指導方針(盧姆和艾薩克,2016;公共利益調查新聞社,2016);抵押貸款和貸款申請越來越依賴機器學習來確定個人的貸款資格 (辛格以及其他,2022);醫療決策越來越受到內部運作不透明的人工智能系統輔助(倫敦,2019); 高風險的軍事決策亦常常取決於自動化決策系統所提供的信息。 

 

對於這一發展的常見擔憂是,自動化決策系統可能在某些方面存在偏見。但這意味著什麼呢? 

 

定義:當系統的行為系統性地偏離某些相關標準時,該系統被認為是有偏見的。這些標準可以是道德的、法律的、認識論的等。(認識論是哲學裡一個涉及知識和證明的分支:你能知道什麼,以及你對此的證明是什麼?)

 

例如,當系統系統性地偏離某些道德標準時,就可能存在道德偏見,而當系統系統性地偏離訓練數據中觀察到的統計規律時,就可能存在統計偏見。不同類型的偏見可以重疊,因此系統可以在某些方面存在偏見而非其他方面,並且可以同時表現出多種不同類型的偏見。 

 

一般來說,自動化決策系統有三個主要部分(圖1)。它們接收一些輸入(圖1),使用複雜的演算法處理這些數據(圖3),並對該輸入產生一個決策作為輸出(圖4)。例如,一家保險公司可能會使用人工智能來決定是否向某人發放貸款。該系統可能會根據他們的薪水、當前工作和信用歷史以及貸款申請的信息輸出「是」或「否」以決定他們是否獲得貸款。

自動化決策系統中的偏見來自何處?自動化決策系統中有三個主要的偏見來源: 

  1. 輸入端偏見 涉及自動化系統使用偏頗的數據,這包括訓練數據和系統在現實世界中使用時遇到的數據。偏見可能源於數據的產生或測量方式。 
  2. 處理偏見 涉及系統使用的演算法或決策過程中的偏見。 
  3. 輸出端偏見 涉及輸出結果如何被使用或部署,尤其是當系統在其預期用途之外或在一般脈絡之外使用時。 

 

你可能會認為所有自動化偏見都是不好的,但情況比這更複雜。有時我們可以利用一種偏見來修正另一種偏見。特別是,由於系統中可以同時存在不同的偏見,我們可以利用良好的偏見來抵消有害或有問題的偏見。例如,信用卡公司可能會調整其演算法,使其更有利於在歷史上面臨不利情況的少數群體,以增加他們獲得信貸機會的概率。在這種情況下,使用一種偏見有助於限制或防止潛在的道德傷害。 

 

在思考自動化決策系統中存在的偏見時,我們應該問兩個問題:(1)偏見在系統中的哪個部分發生(輸入端、處理端或輸出端?),(2)這些偏見如何重疊和相互關聯?考慮這兩個方面將幫助我們全面理解系統的利益和危害。

1995036612

自動化決策系統

這段視頻將概述自動化決策系統中潛在災難性偏見的來源和潛在應對方式。

人工智能價值對齊

本部分將使學生具備以下能力:

  1. 理解人工智能價值對齊問題
  2. 理解「正交論」及其在對齊問題中的作用
  3. 評估人工智能對人類潛在的存在性風險
     
人工智能價值對齊

我們目前正生活在一個人工智能技術飛速發展的時代。就在幾年前,人工智能系統的編碼、寫詩和標準化測試能力達到人類水平幾乎是不可想像的。現在,隨著 GPT-4 等程式的發布,這已成為現實。但我們沒有理由認為人工智能系統的能力會停留在目前的水平上。未來,甚至是不久的將來,人工智能系統的能力可能會遠遠超過我們目前所知的任何系統。然而,隨著先進人工智能系統的發展,我們也面臨著新的風險。在本節中,我們將討論一種由人工智能價值對齊問題引發的風險。所謂價值對齊問題,指的是確保人工智能系統的行為符合人類普遍認同的價值觀。

先進人工智能的發展會帶來許多類型的風險。其中一些風險可能非常嚴重,但並非災難性的。但另一些則可能是災難性的。所謂災難性風險,我們指的是可能威脅到相當一部分人類的生命或福祉的風險。因此,舉例來說,發達經濟體中數以百萬計的知識工作者有可能因人工智能而失業。這是一個非常嚴重的風險,但不一定是災難性的。另一方面,控制核武器的人工智能系統可能會引發全球核戰爭,這是一種災難性風險。人工智能採取某種行動摧毀先進的工業文明,使我們回到石器時代的風險也是如此。

1049248684

為什麼人工智能系統會採取具有如此災難性後果的行動呢?一個潛在的原因是它的價值觀與我們不一致。我們所說的價值是指事物所追求的目的或目標。例如,人類的共同價值包括身體舒適、安全、有意義的人際關系等。人類也重視實現這些目的的手段,如金錢或地位,它們可以用來獲得這些有價值的物品。當兩個或兩個以上的行為主體具有相同的價值觀時,就是價值對齊。因此,舉例來說,人類一般傾向共享許多價值觀,即使他們對其他價值觀存在分歧。儘管大多數人類可能對未來的發展方向存在分歧,他們仍重視人類物種的延續。但在其他情況下,我們的價值觀可能並不一致。這就會造成衝突。從根本上說,戰爭的發動就是因為價值觀未能對齊:兩國的價值觀不同,並將軍事衝突視為解決分歧的唯一手段。

 

一群有影響力的人工智能研究人員正在關注人工智能因價值對齊問題而帶來的災難性風險。一般理解下,價值對齊問題是確保未來的人工智能系統按照人類價值觀行事的技術問題。令人擔憂的是,在近期到中期的未來,我們可能會開發出不認同人類價值觀卻非常強大的人工智能系統。這包括可能出現在那些超級智能人工智能系統中, 它們基本上每項任務上都勝過人類。令人擔憂的是,這些先進的人工智能系統可能會以與人類價值觀相悖的方式行事,並可能帶來災難性的結果。在下面的視頻中,我將通過討論一個著名的思想實驗來扼要解釋這個問題:迴紋針極大化生產器,這是尼克·博斯特羅姆(Nick Bostrom)和埃利澤·尤德科夫斯基(Eliezier Yudkowsky)討論過的一個著名思想實驗(博斯特羅姆,2003 年)。
 

迴紋針極大化生產器

在這段視頻中,我們描述了一個著名的思想實驗以說明人工智能的對齊問題。

解決對齊問題

要避免這種結果,顯而易見的建議是確保人工智能系統認同人類的價值觀。為什麼不干脆把人工智能系統的終極目標設定為改善人類福祉之類的一般性目標呢?不幸的是,這個建議——我們只需為之內建人類價值觀——面臨著許多嚴重的問題。在此,我將概述三個問題:

1. 指定人類價值觀:我們不知道人類的終極價值觀是什麼,而且對這些價值觀存在著深刻而長久的分歧。

2. 確保接收:即使我們知道人類的終極價值觀是什麼,我們也無法知道我們是否成功地將這些價值觀編進了人工智能系統。

3. 意外後果:即使我們解決了關於人類價值觀的分歧,並將這些價值觀編入人工智能,也可能會產生意外後果。

2148460261

我將依次思考這些問題。

 

首先,「人類價值觀」一詞並不清晰,且要使其精確並不容易。關於在眾多基本道德價值觀中,應該設定哪些作為人工智能系統的目標,人們並未達成共識。例如,一些道德哲學家採取激進的後果論,或認為只有行為的後果——而非動機或是否違反直覺正義原則等其他因素——才與道德相關的倫理立場。在後果論者看來,犧牲一部分人的福祉來為另一部分人提供更大的利益,這不僅在道德上是可以接受的,甚至在道德上是必須的。還有許多人拒絕接受這種後果論觀點,而是認為每個人都有某些不可剝奪的權利,即使是為了某種「更大的利益」,也不能干涉這些權利。

 

其次,即使我們就價值觀的本質達成了一致,要將這些價值觀灌輸到人工智能系統中仍是艱巨的技術挑戰。這說起來容易做起來難。目前用於創建人工智能系統的機器學習策略是臭名昭著的不透明。目前,機器學習方法創建的人工智能系統實際上採用了哪些規則或目標,仍是一個尚未解決的問題。一個根據申請人的預估能力對簡歷進行排序的系統,可能會學習到一些有問題的規則,比如優待與過往傳統上被這些職位錄用的人擁有同類名字的申請人。只有仔細審查這類系統的輸出結果,才能發現它們使用了不恰當的程序。同樣,一個系統可能會在訓練中以符合人類價值觀的方式行事,但應用到現實部署時卻不然。

 

第三,即使我們確定了「正確」的價值觀,並想出了如何將其編程到人工智能系統中,也可能會產生意想不到的後果。假設道德的終極目標是減少痛苦,我們將這一目標賦予人工智能系統。 系統可能會認為,實現這一目標的最好辦法就是消滅所有有意識的生命,因為沒有意識就沒有痛苦。又或者,道德的終極目標是產生盡可能多的快樂,但要做到這一點,最簡單的辦法是將人類連接上可人工刺激大腦快樂中樞的裝置。這些設想看似離奇,但亦可以說是廣為接受的道德理論的合理延伸。我們不可能輕易提前知道一個高智商、高能力的人工智能系統是否會和我們一樣,按照「常識」厭惡這些想法。

 

由於這些原因,價值對齊問題帶來了嚴重的風險,甚至可能是災難性的風險。如果沒有某種方法可以可靠地向人工智能系統灌輸適當的價值觀,它們會發展出怎樣的價值觀就只能聽天由命。考慮到這些系統潛在的超人能力,這將給人類帶來巨大風險。 
 

解決價值對齊問題

 

在本節探討了對齊問題之後,我現在想考慮一下潛在的解決方案。我們該如何解決對齊問題。粗略而言,解決工夫可分為兩類。首先,許多人工智能研究人員正在研究技術解決方案,例如試圖讓人工智能系統的行為更容易被設計者理解。但這些技術問題目前仍未解決。其次,一些人工智能研究人員主張放慢甚至暫停人工智能研究。最近,近千名學者和研究人員簽署了一封公開信,建議暫停推進人工智能研究 6 個月。這些政策是否會被社會採納,是我們必須做出的集體決定。

 

我們不想給人一種印象,認為價值對齊問題是無法解決的。許多非常聰明、心地善良的人正在努力試圖防止未來潛在的人工智能系統導致類似上述視頻中討論的災難。但問題確實存在。因為我們很難看到未來人工智能系統的價值觀可能與我們的價值觀產生分歧的所有潛在方式。假設這些系統和我們一樣聰明,甚至更聰明,那麼我們就需要確保它們的價值觀與我們的價值觀一致。
 

Bostrom, Nick. (2003). ‘Ethical issues in Advanced Artificial Intelligence.’ URL: https://nickbostrom.com/ethics/ai.

 

Bostrom, Nick. Superintelligence: paths, dangers, strategies. Oxford University Press.

問題1:自動決策系統出現偏見意味著什麼?自動決策系統偏見的主要來源是什麼?

問題2:什麼是正交論?它如何影響人工智能系統對人類構成的潛在風險?