单元 5:人工智能风险

快速存取人工智能风险简介 | 自动化决策系统中的偏见 | 人工智能价值对齐 | 自我测试

指导老师:Adam Bradley 教授、 Andre Curtis-Trudel 教授

人工智能风险简介

先进的人工智能系统为我们生活作出的关键决策越来越多。这些决定包括财务方面(我的贷款会被批准吗?),刑事司法方面(应否让某犯罪嫌疑人保释?),健康方面(这张 X 光片是否显示患有肺癌?),以及大众传播方面(应该推广哪些新闻报道?)。很快,自主人工智能系统可能会直接控制重要的军事系统,能源电网的关键部分和风险的生物技术项目。在执行这些任务时,人工智能系统通常以连人类专家都无法理解或解释的方式运行。开发这些人工智能系统,并使用它们来执行这些重要任务会带来一些严重的风险。在这个单元中,我们从哲学的角度讨论当中最严重的风险。

本单元首先为不太熟悉当代人工智能系统的人提供简略介绍。 然后,它将通过深入研究两个主题来探讨人工智能风险。

1. 自动化偏见:我们如何确保人工智能系统做出的决策是公平的?
2. 价值对齐问题:我们如何确保人工智能系统按照人类价值行事?

AI Risk

人工智能风险概论 

 

学习成果

本部分将使学生具备以下能力: 

  1. 识别人工智能系统和技术的主要种类。 
  2. 解释当代人工智能系统的典型开发周期。 
  3. 解释人工智能的一些主要商业、法律、政府、医疗和科学用途。 

 

在最广泛的层面上,人工智能是设计出系统以求在特定任务——那些由人类执行的话,会被视为需要「智能」的任务——上展现出人类水平表现的项目。随着第一批数码电脑的建造,人们对人工智能的兴趣在很大程度上始于 20 世纪 50 年代。虽然按照今天的标准来说,这些机器是简陋的,但研究人员立即意识到它们解决复杂问题的巨大力量。大约 70 年后的今天,人工智能系统在各种任务上表现出人类水平或超越人类水平的表现。 它们可以下象棋,下围棋,通过律师考试,写论文,生成图像,还有更多更多。

 

虽然这些发展是令人兴奋的,而且往往是有益的,但它们也给人类带来了新的挑战。 如果有人使用人工智能系统传播政治错误信息怎么办?如果军事人工智能决定以平民为目标,或者更糟糕的是,使用核武器怎么办?一个超级智能的人工智能能以某种方式控制和奴役人类吗?这些只是人工智能技术带来的一些潜在风险。

本单元将帮助你更好地了解这些风险。在这篇文章中,我们讨论了人工智能的广泛使用所带来的各种具体风险,以及这种使用所带来的潜在未来风险。你不需要任何人工智能的背景知识来完成这个单元。在本单元的余下部分中,我们简要概述了人工智能的相关面向。如果你对人工智能已有深厚认知,你可以跳过此视频。但如果你是人工智能的新手,它可能会帮助你了解人工智能带来的潜在风险。在本单元的余下部分中,我们将更详细地讨论特定的人工智能风险。

1746666469

人工智能技术的基础知识

在这段视频中,我们说明了人工智能技术的一些基础知识,以提供理解人工智能风险所需的背景。

自动化决策系统中的偏见

学习成果 本部分将使学生具备以下能力:
1. 辨识自动化决策系统中偏见的主要来源。
2. 解释与偏见决策系统相关的一些主要风险。
3. 从道德、法律和认识论多种角度评估应对自动化偏见的不同方法。

Diagram 1-4

简介自动化决策系统中的偏见

 

自动化偏见是什么,以及它从何而来? 

自动化决策系统通常由先进的人工智慧技术驱动,现在被用于各种领域的预测:预测性警务技术用于根据个人的再犯风险预测来决定保释和判刑指导方针(卢姆和艾萨克,2016;公共利益调查新闻社,2016);抵押贷款和贷款申请越来越依赖机器学习来确定个人的贷款资格 (辛格以及其他,2022);医疗决策越来越受到内部运作不透明的人工智能系统辅助(伦敦,2019); 高风险的军事决策亦常常取决于自动化决策系统所提供的信息。 

 

对于这一发展的常见担忧是,自动化决策系统可能在某些方面存在偏见。但这意味着什么呢? 

 

定义:当系统的行为系统性地偏离某些相关标准时,该系统被认为是有偏见的。这些标准可以是道德的、法律的、认识论的等。(认识论是哲学里一个涉及知识和证明的分支:你能知道什么,以及你对此的证明是什么?)

 

例如,当系统系统性地偏离某些道德标准时,就可能存在道德偏见,而当系统系统性地偏离训练数据中观察到的统计规律时,就可能存在统计偏见。不同类型的偏见可以重叠,因此系统可以在某些方面存在偏见而非其他方面,并且可以同时表现出多种不同类型的偏见。 

 

一般来说,自动化决策系统有三个主要部分(图1)。它们接收一些输入(图1),使用复杂的演算法处理这些数据(图3),并对该输入产生一个决策作为输出(图4)。例如,一家保险公司可能会使用人工智能来决定是否向某人发放贷款。该系统可能会根据他们的薪水、当前工作和信用历史以及贷款申请的信息输出「是」或「否」以决定他们是否获得贷款。

自动化决策系统中的偏见来自何处?自动化决策系统中有三个主要的偏见来源: 

  1. 输入端偏见 涉及自动化系统使用偏颇的数据,这包括训练数据和系统在现实世界中使用时遇到的数据。偏见可能源于数据的产生或测量方式。 
  2. 处理偏见 涉及系统使用的演算法或决策过程中的偏见。 
  3. 输出端偏见 涉及输出结果如何被使用或部署,尤其是当系统在其预期用途之外或在一般脉络之外使用时。 

 

你可能会认为所有自动化偏见都是不好的,但情况比这更复杂。有时我们可以利用一种偏见来修正另一种偏见。特别是,由于系统中可以同时存在不同的偏见,我们可以利用良好的偏见来抵消有害或有问题的偏见。例如,信用卡公司可能会调整其演算法,使其更有利于在历史上面临不利情况的少数群体,以增加他们获得信贷机会的概率。在这种情况下,使用一种偏见有助于限制或防止潜在的道德伤害。 

 

在思考自动化决策系统中存在的偏见时,我们应该问两个问题:(1)偏见在系统中的哪个部分发生(输入端、处理端或输出端?),(2)这些偏见如何重叠和相互关联?考虑这两个方面将帮助我们全面理解系统的利益和危害。

1995036612

自动化决策系统

这段视频将概述自动化决策系统中潜在灾难性偏见的来源和潜在应对方式。

人工智能价值对齐

本部分将使学生具备以下能力:

  1. 理解人工智能价值对齐问题
  2. 理解「正交论」及其在对齐问题中的作用
  3. 评估人工智能对人类潜在的存在性风险
     
人工智能价值对齐

我们目前正生活在一个人工智能技术飞速发展的时代。就在几年前,人工智能系统的编码、写诗和标准化测试能力达到人类水平几乎是不可想像的。现在,随着 GPT-4 等程式的发布,这已成为现实。但我们没有理由认为人工智能系统的能力会停留在目前的水平上。未来,甚至是不久的将来,人工智能系统的能力可能会远远超过我们目前所知的任何系统。然而,随着先进人工智能系统的发展,我们也面临着新的风险。在本节中,我们将讨论一种由人工智能价值对齐问题引发的风险。所谓价值对齐问题,指的是确保人工智能系统的行为符合人类普遍认同的价值观。

先进人工智能的发展会带来许多类型的风险。其中一些风险可能非常严重,但并非灾难性的。但另一些则可能是灾难性的。所谓灾难性风险,我们指的是可能威胁到相当一部分人类的生命或福祉的风险。因此,举例来说,发达经济体中数以百万计的知识工作者有可能因人工智能而失业。这是一个非常严重的风险,但不一定是灾难性的。另一方面,控制核武器的人工智能系统可能会引发全球核战争,这是一种灾难性风险。人工智能采取某种行动摧毁先进的工业文明,使我们回到石器时代的风险也是如此。

1049248684

为什么人工智能系统会采取具有如此灾难性后果的行动呢?一个潜在的原因是它的价值观与我们不一致。我们所说的价值是指事物所追求的目的或目标。例如,人类的共同价值包括身体舒适、安全、有意义的人际关系等。人类也重视实现这些目的的手段,如金钱或地位,它们可以用来获得这些有价值的物品。当两个或两个以上的行为主体具有相同的价值观时,就是价值对齐。因此,举例来说,人类一般倾向共享许多价值观,即使他们对其他价值观存在分歧。尽管大多数人类可能对未来的发展方向存在分歧,他们仍重视人类物种的延续。但在其他情况下,我们的价值观可能并不一致。这就会造成冲突。从根本上说,战争的发动就是因为价值观未能对齐:两国的价值观不同,并将军事冲突视为解决分歧的唯一手段。

 

一群有影响力的人工智能研究人员正在关注人工智能因价值对齐问题而带来的灾难性风险。一般理解下,价值对齐问题是确保未来的人工智能系统按照人类价值观行事的技术问题。令人担忧的是,在近期到中期的未来,我们可能会开发出不认同人类价值观却非常强大的人工智能系统。这包括可能出现在那些超级智能人工智能系统中, 它们基本上每项任务上都胜过人类。令人担忧的是,这些先进的人工智能系统可能会以与人类价值观相悖的方式行事,并可能带来灾难性的结果。在下面的视频中,我将通过讨论一个著名的思想实验来扼要解释这个问题:回纹针极大化生产器,这是尼克・博斯特罗姆(Nick Bostrom)和埃利泽・尤德科夫斯基(Eliezier Yudkowsky)讨论过的一个著名思想实验(博斯特罗姆,2003 年)。
 

回纹针极大化生产器

在这段视频中,我们描述了一个著名的思想实验以说明人工智能的对齐问题。

解决对齐问题

要避免这种结果,显而易见的建议是确保人工智能系统认同人类的价值观。为什么不干脆把人工智能系统的终极目标设定为改善人类福祉之类的一般性目标呢?不幸的是,这个建议——我们只需为之内建人类价值观——面临着许多严重的问题。在此,我将概述三个问题:

1. 指定人类价值观:我们不知道人类的终极价值观是什么,而且对这些价值观存在着深刻而长久的分歧。

2. 确保接收:即使我们知道人类的终极价值观是什么,我们也无法知道我们是否成功地将这些价值观编进了人工智能系统。

3. 意外后果:即使我们解决了关于人类价值观的分歧,并将这些价值观编入人工智能,也可能会产生意外后果。

2148460261

我将依次思考这些问题。

 

首先,「人类价值观」一词并不清晰,且要使其精确并不容易。关于在众多基本道德价值观中,应该设定哪些作为人工智能系统的目标,人们并未达成共识。例如,一些道德哲学家采取激进的后果论,或认为只有行为的后果——而非动机或是否违反直觉正义原则等其他因素——才与道德相关的伦理立场。在后果论者看来,牺牲一部分人的福祉来为另一部分人提供更大的利益,这不仅在道德上是可以接受的,甚至在道德上是必须的。还有许多人拒绝接受这种后果论观点,而是认为每个人都有某些不可剥夺的权利,即使是为了某种「更大的利益」,也不能干涉这些权利。

 

其次,即使我们就价值观的本质达成了一致,要将这些价值观灌输到人工智能系统中仍是艰巨的技术挑战。这说起来容易做起来难。目前用于创建人工智能系统的机器学习策略是臭名昭着的不透明。目前,机器学习方法创建的人工智能系统实际上采用了哪些规则或目标,仍是一个尚未解决的问题。一个根据申请人的预估能力对简历进行排序的系统,可能会学习到一些有问题的规则,比如优待与过往传统上被这些职位录用的人拥有同类名字的申请人。只有仔细审查这类系统的输出结果,才能发现它们使用了不恰当的程序。同样,一个系统可能会在训练中以符合人类价值观的方式行事,但应用到现实部署时却不然。

 

第三,即使我们确定了「正确」的价值观,并想出了如何将其编程到人工智能系统中,也可能会产生意想不到的后果。假设道德的终极目标是减少痛苦,我们将这一目标赋予人工智能系统。 系统可能会认为,实现这一目标的最好办法就是消灭所有有意识的生命,因为没有意识就没有痛苦。又或者,道德的终极目标是产生尽可能多的快乐,但要做到这一点,最简单的办法是将人类连接上可人工刺激大脑快乐中枢的装置。这些设想看似离奇,但亦可以说是广为接受的道德理论的合理延伸。我们不可能轻易提前知道一个高智商、高能力的人工智能系统是否会和我们一样,按照「常识」厌恶这些想法。

 

由于这些原因,价值对齐问题带来了严重的风险,甚至可能是灾难性的风险。如果没有某种方法可以可靠地向人工智能系统灌输适当的价值观,它们会发展出怎样的价值观就只能听天由命。考虑到这些系统潜在的超人能力,这将给人类带来巨大风险。 
 

解决价值对齐问题

 

在本节探讨了对齐问题之后,我现在想考虑一下潜在的解决方案。我们该如何解决对齐问题。粗略而言,解决工夫可分为两类。首先,许多人工智能研究人员正在研究技术解决方案,例如试图让人工智能系统的行为更容易被设计者理解。但这些技术问题目前仍未解决。其次,一些人工智能研究人员主张放慢甚至暂停人工智能研究。最近,近千名学者和研究人员签署了一封公开信,建议暂停推进人工智能研究 6 个月。这些政策是否会被社会采纳,是我们必须做出的集体决定。

 

我们不想给人一种印象,认为价值对齐问题是无法解决的。许多非常聪明、心地善良的人正在努力试图防止未来潜在的人工智能系统导致类似上述视频中讨论的灾难。但问题确实存在。因为我们很难看到未来人工智能系统的价值观可能与我们的价值观产生分歧的所有潜在方式。假设这些系统和我们一样聪明,甚至更聪明,那么我们就需要确保它们的价值观与我们的价值观一致。
 

Bostrom, Nick. (2003). ‘Ethical issues in Advanced Artificial Intelligence.’ URL: https://nickbostrom.com/ethics/ai.

 

Bostrom, Nick. Superintelligence: paths, dangers, strategies. Oxford University Press.

问题1:自动决策系统出现偏见意味着什么?自动决策系统偏见的主要来源是什么?

问题2:什么是正交论?它如何影响人工智能系统对人类构成的潜在风险?