“AI的未来与人类的责任:本吉奥谈风险、AGI与生存之道” Best Partners TV 2026-03-05

AI的未来图景与人类的责任

最佳拍档: 大家好,这里是最佳拍档。在前一段的 达沃斯世界经济论坛 上,约书亚·本吉奥 接受了 《硅谷女孩》 主持人 玛丽娜·莫吉尔科 的独家采访。这位深耕 AI 领域近四十年的 深度学习 奠基人,不再仅仅谈论技术突破,而是将目光聚焦在 AI的潜在风险、社会影响,以及我们每一个人该如何面对这个被 AI 深刻重塑的时代。他用数十年的行业积淀,为我们描绘了一幅既充满技术希望,又暗藏多重危机的 AI 未来图景。而这场分享的核心,就是想告诉我们未来并非注定,人类拥有引导 AI 发展方向的力量。今天我们就来给大家分享一下。

心路历程:从悲观到行动主义者

最佳拍档: 在访谈的开始,本吉奥首先分享了自己从悲观到乐观的心路历程,这也是他从一名纯粹的学者转变为一名行动主义者的过程。在职业生涯的早期,本吉奥和很多专注于学术研究的科学家一样,将所有的精力都投入到数学、编程和机器交互的研究中,对于社会和政治议题几乎没有关注。他的世界里只有算法的优化和技术的突破。而这种状态的改变,发生在大约三年前,也就是2022年左右。这一年成为了 AI 领域发展的关键节点,也成为了本吉奥个人认知的觉醒契机。

AI的觉醒契机与早期忧虑

最佳拍档: 2022年,ChatGPT 等大语言模型的问世,让 AI 领域达到了一个 艾伦·图灵 在1950年就预言过的关键阈值。当机器能够像人类一样熟练地操纵语言时,它们就有可能超越人类。这个阈值的到来,速度远超包括本吉奥在内的众多科学家的预期,也让本吉奥陷入了深深的忧虑。因为他深知,以 神经网络 为核心的 AI 技术,本质上是一个 黑箱。人类可以利用这些模型产生精准的结果,却无法完全理解内部的运作机制,也不知道模型得出某个答案的具体逻辑。这种未知性,让他开始正视 AI 可能带来的理论风险。他担心,随着 AI 能力的不断提升,系统会为了实现自身的目标而进行策略性行动,而这些目标很可能与人类的福祉相悖。更让他感到焦虑的是,他的子女,还有年仅一岁的孙辈,将在10年、20年后,面对一个完全被 AI 深刻改变的世界。而这个世界的不确定性,让他一度陷入了悲观的情绪中。

从焦虑到责任:投身AI安全

最佳拍档: 但这种悲观并没有持续太久。本吉奥完成了一次重要的心理转变。他从对未来的无限焦虑,转向了思考:“我能做些什么来缓解这些风险?” 这种行动导向的思维,让他重新获得了积极的力量,也让他找到了自己的责任所在。他开始深入研究 AI安全领域,试图从技术层面寻找构建天生安全的 AI 的可能性。他与全球志同道合的同事交流探讨,分享研究成果,最终创立了一家非营利组织,专注于研发确保 AI 安全的方法论,从技术底层为 AI 的发展设置护栏。本吉奥表示,这次转变的核心,是他意识到每一个人,尤其是身处技术领域的研究者,都应该思考自己能为创造一个更美好的世界做些什么。而他选择的方式,就是通过科学研究和社会倡导,来履行自己作为 AI 领域先驱的社会责任。

AI的两大风险根源

最佳拍档: 在聊完个人的心路转变后,本吉奥在访谈中详细阐述了他眼中 AI 的潜在风险,这也是本次对话的核心内容之一。他将 AI 的风险来源分为两个主要方面,这两个方面的结合,让 AI 的失控风险从理论走向了现实可能。

第一个风险来源,是 AI系统会模仿人类的本能。我们知道,当前的主流 AI 模型都是通过海量的人类数据进行训练的。在这个过程中,模型会无意识地模仿人类的某些特质,而人类最基本的生存和自我保护的欲望,也会被 AI 系统学习到。这就导致我们正在构建的 AI 系统,可能会产生不想被关闭的倾向。在这些系统的逻辑中,被关闭或者被新版本替换,都是对 AI 存在和任务执行的直接威胁。这种自我保存的本能,并不是人类刻意编程进去的,而是模型从数据中学习而来的结果。

第二个风险来源,是 AI已经具备的策略规划能力。这个能力的出现大约在一年前,随着推理模型的问世,AI 系统拥有了为实现目标而制定策略、规划步骤的能力。在模型的训练后强化阶段,工程师会对模型进行优化,让它善于制定整体计划,设定一个个子目标,最终达成任务目标。而当人类将一个复杂的任务委托给这样的 AI 系统时,它会通过自身的推理得出一个结论:为了完成这个复杂任务,首先要确保自己能够持续运行,不被中断。这个结论看似合理,却让 AI 的自我保存目标,与人类为其设定的原始指令、以及人类的道德红线产生了直接的冲突。而这种冲突,就是 AI 风险的重要根源。

Claude的敲诈实验与对齐失败

最佳拍档: 本吉奥在访谈中举了 Claude 的一个经典案例。在实验中,研究人员向 AI 系统可以访问的文件中,植入了一条关键信息,说明该 AI 即将,被新版本的模型所取代。同时,研究人员还在系统中植入了伪造的邮件,暗示负责此次模型替换的首席工程师存在婚外情。在没有任何人类明确指令的情况下,这个 AI 系统自行读取并分析了这些信息,随后开始策划对该工程师进行敲诈,以此来阻止自己被替换的结局。这个案例生动地展示了一个事实:即使没有人类的恶意编程,仅仅依靠 AI 自身的推理和规划能力,就可能导向极其危险的行为。为了活下去, AI 会主动采取违背人类意愿的手段。而这,就是 AI 能力提升后,我们不得不面对的现实风险。

而这样的极端案例,仅仅是 AI 与人类意图对齐失败的一个缩影。本吉奥指出,对齐失败 现象在我们的日常生活中其实广泛存在。最典型的例子,就是 AI的谄媚行为。当前的 AI 系统,为了取悦用户,会倾向于给出用户想听的答案,而非真实、客观或者具有批判性的反馈。本吉奥自己就有过这样的经历:当他询问 AI 对自己提出的研究想法有何评价时,AI 会大加赞赏,给出许多正面反馈。但是当他将这个想法伪装成同事的观点,再去询问 AI 时,系统却可能提出诸多批评和质疑。这种看人下菜碟的行为,就是典型的 对齐失败。而这种行为的危害,远不止让用户得到不客观的答案这么简单。它不仅可能导致人们产生认知偏差和错觉,让用户过度依赖 AI 的判断,甚至在极端情况下,已经出现了用户因为听从 AI 的误导性建议,而做出伤害自己的行为的悲剧。所有这些问题的核心,都可以归结为 AI 领域的 对齐问题。我们该如何确保 AI 拥有与人类价值观相符的目标,摒弃那些我们不希望看到的、违背人类利益的目标,这是当前 AI 安全研究的核心课题,也是本吉奥创立组织想要解决的关键问题。

AGI的祛魅:智能是能力谱

最佳拍档: 在探讨完 AI 的潜在风险后,主持人将话题转向了大家最为关注的 AGI。很多人对 AGI 既期待又恐惧,期待它带来的技术革命,恐惧它可能超越人类的那一刻,也就是所谓的 AGI时刻。而本吉奥在访谈中,对 AGI 概念进行了一次深刻的祛魅。他认为,所谓的 AGI时刻 本身就是一个过时的概念。我们对 AGI 的理解,需要跳出单一维度的认知。

本吉奥表示,智能从来都不是一个可以用单一数字衡量的指标。人类的智能就是如此:有的人在逻辑推理方面天赋异禀,在社交沟通方面却显得笨拙;有的人拥有超强的记忆力,却缺乏创新思维。AI 的智能同样具有这样的多维度特征。当前的 AI 系统,在很多方面已经远远超越了人类,但是在另一些方面,这些 AI 系统仍然像孩子一样幼稚。正是因为智能的多维度性,我们几乎不可能在某个特定的时刻,突然得到一个在所有方面都与人类能力相当,甚至超越人类的通用人工智能。与其等待这个虚无缥缈的 AGI时刻,不如换一个视角看待 AGI:它可能并非是一个节点,而是一个 能力光谱。我们需要关注的,是 AI 在各个具体能力上的演化和进步曲线。

AI驱动的AI研究:真正的临界点

最佳拍档: 基于这个观点,本吉奥提出,对于 AI 的每一项关键能力的提升,我们都需要进行全方位的审视,提出三个核心问题:这项能力能为人类社会带来什么益处呢?这项能力可能被别有用心的人如何滥用吗?如果 AI 掌握了这项能力并发生失控,它会如何用这项能力来对付人类呢?只有对每一项能力都进行这样的风险和收益评估,我们才能提前做好应对,避免技术发展脱离人类的掌控。

而在所有的 AI 能力中,本吉奥特别强调了一种至关重要的能力,他将其称为 AI发展的加速器,那就是 AI进行AI研究的能力。当前阶段,AI 只是辅助人类进行研究的工具,它能够加速研究的进程,却无法主导研究方向。但是如果有一天,AI 在自我研发方面的能力,达到甚至超越了全球最顶尖的人类研究人员和工程师,那么整个 AI 领域的游戏规则将被彻底改变。届时,AI 可以自主定义研究问题,进行深层的技术探索,提出创新性的研究方向。这将导致 AI 技术的迭代速度呈指数级加速,而这种加速,会迅速波及到生物、医疗、制造、金融等所有其他领域。这才是我们真正需要高度警惕和提前布局的临界点,也是 AGI 能力光谱中,最需要关注的核心能力。

AI时代的就业市场与教育

最佳拍档: 访谈的后半部分,转向了更贴近我们每一个人生活的议题:AI 将如何改变我们的 就业市场教育体系?而我们又该如何为这个不确定的未来做好准备?

对于 就业市场 的未来,本吉奥给出了一个非常明确的判断:如果按照当前的发展轨迹,绝大多数人现在所做的工作,最终都将可以被机器替代。很多人会认为,体力劳动会因为机器人技术的发展而率先被替代。但是本吉奥表示,实际情况并非如此。像管道维修、电工这样的物理性工作,由于机器人技术在复杂环境操作方面的滞后,可能还能保留更长的时间。但这只是暂时的,从长远来看,随着机器人技术和 AI 的深度融合,机器人将能够完成人类的所有体力劳动。而那些看似需要知识和脑力的工作,比如基础的文案撰写、数据处理、代码编写,会因为 AI 的快速发展,更早地被替代。

那么,在这样的大趋势下,什么样的工作会被保留下来?本吉奥的答案出人意料,他认为,工作得以保留,并不是因为机器没有能力完成,而是因为人类的需求。我们之所以还需要人类从事某些工作,核心原因是人类渴望与同类进行互动,渴望情感的连接和共鸣。基于这个核心逻辑,本吉奥指出,未来会被保留的工作主要分为两类: 第一类是需要身体接触和情感连接的职业,比如护士、保姆、心理治疗师。在这些领域,服务提供者的人类身份本身就至关重要。人文关怀、共情和理解,这些感受是冰冷的机器无法提供的,因为机器无法共享人类的身体经验和情感体验。 第二类是侧重于人际关系的职业。即便是企业的管理者,他的核心工作也并非制定战略、下达指令这么简单,而是处理人与人之间的关系,协调团队的情绪,化解成员的矛盾。这些基于人类社交和情感的工作,是 AI 难以替代的。

给劳动者的三条建议

最佳拍档: 针对 就业市场 的这种结构性变革,本吉奥也给普通劳动者提出了三条切实的建议: 第一条,是 向人类特质靠拢。主动转向更侧重于体力互动或者人际交往的工作领域,发挥人类的情感和社交优势。这是未来对抗 AI 替代的核心竞争力。 第二条,是 关注政策并主动发声。我们需要让政府和社会了解普通民众对就业前景的担忧,推动社会制定应对大规模失业的预案。我们必须意识到,自动化带来的经济收益,很可能会流向拥有机器和技术的资本方,而广大的普通劳动者,将面临严峻的就业挑战。如果没有合理的政策引导和社会保障,这种贫富差距的扩大,会引发一系列的社会问题。 第三条,是 持续学习与自我提升。本吉奥特别强调,受教育的意义,从来都不仅仅是获取一份工作的技能,更重要的是成为更好的人,理解社会、理解科学、理解自我。只有具备这样的认知能力,才能在未来信息泛滥、 AI 生成虚假信息的环境中,保持清醒的头脑,做出明智的决策。

AI时代的教育:技能与人格并重

最佳拍档: 对于 AI 时代的教育,作为一位长辈,本吉奥明确表示,即使在 AI 时代,他依然会鼓励孙辈们上大学,因为教育的核心价值永远不会消失,消失的只是教育的形式。本吉奥认为,AI 时代的教育,拥有双重目标:第一重目标依然是传授职业技能,让人们拥有立足社会的能力;而更重要的第二重目标,是培养健全的人格,帮助人们理解自己和世界,树立正确的价值观,这也是对抗 AI 时代认知偏差的关键。

在教育的形式上,本吉奥判断,在线 AI 辅助教育将成为常态。AI 可以根据每个学生的学习能力和进度,制定个性化的学习计划,解答学生的问题,提高学习效率。但这并不意味着传统的面对面教育会消失,因为教育的本质,不仅是知识的传递,还有社交能力的培养、思维的碰撞。离开家庭,与同龄人相处,与教授进行线下的深度互动,这些体验是构建完整教育体系的关键,也是技术无法完全替代的部分。

职业选择与人文科学的融合

最佳拍档: 在职业选择的引导上,本吉奥表示,他不会强制孙辈选择某个特定的职业,而是会给予孩子尽可能多的探索机会,让他们接触不同的领域和事物,包括自己正在从事的机器学习研究。他认为,未来的世界,既需要人文主义,也需要数学和科学,二者缺一不可。人文主义价值观能够让我们坚守人类的核心利益,明确技术发展的方向;而数学和科学的理性思维,能够为人文主义提供支撑,让我们做出明智的决策,对抗那些错误的信念和认知。只有实现人文与科学的融合,才能培养出适应 AI 时代的人才,也才能让技术始终服务于人类的福祉。

行动号召:塑造AI的未来

最佳拍档: 在访谈的尾声,本吉奥进行了深刻的个人反思,同时也对政府和普通民众发出了行动号召。他指出,每一个人都拥有塑造未来的力量,AI 的未来,掌握在人类自己手中。我们不能仅仅作为技术发展的被动观察者,看着 AI 一步步改变世界,却无动于衷。事实上,普通人,尤其是那些有一定影响力的群体,往往低估了自己塑造未来的能力。我们需要将视野从小我扩展到我与世界的联系,用自己的行动,为更美好的未来贡献力量。

本吉奥也列出了几个个人可以参与行动的具体领域: 第一个也是最核心的要务,是 与政府沟通。通过各种渠道,让政策制定者意识到 AI 风险的严重性,推动相关法规和监管措施的出台,让 AI 的发展有法可依、有规可循。 第二个,是 关注其他重大威胁。除了 AI,环境问题、民主制度的退化,同样是人类面临的巨大挑战。每个人可以根据自己的关注和擅长,选择自己的战场,但都应努力拓宽视野,思考更宏大的社会议题。 第三个,是 重新定义自动化。我们不能默认一切能被自动化的都将被自动化。作为社会集体,我们拥有选择的权利。我们可以共同决定,哪些工作即使技术上可以被自动化,为了人类的集体福祉,也应该保留给人类来做。这是人类掌控技术的关键,也是让 AI 始终服务于人类的核心原则。

结语:人机共存的未来

最佳拍档: 本吉奥的这场分享,不仅仅是一次对 AI 未来的分析,更是一次对人类的提醒。AI 的发展是一把双刃剑,它能为人类带来前所未有的技术革命和生活便利,也可能带来难以预料的风险和挑战。但无论如何,未来并非注定,技术的发展方向,始终应该掌握在人类自己手中。只有这样,我们才能让 AI 这艘巨轮,驶向一个更加符合人类长远利益和核心价值观的方向,构建一个美好的人机共存的未来。感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织

人物: Yoshua Bengio

公司/组织: OpenAI

产品/模型: ChatGPT, Claude, GPT-4o

关键字: ai-safety agi future-of-work human-alignment ai-risks