核心摘要

人工智能安全研究机构Anthropic顶尖研究员埃文·赫宾格近日在社交平台X上发布引发广泛关注的警告帖,明确表示他个人认为未来十年内人工智能"有可能灭绝全人类"的概率超过百分之十,并指出Anthropic目前"尚未拥有解决超级智能对齐问题的方案,也未明显走在正确轨道上"。这一表态发布之时,英国《金融时报》披露Anthropic暂缓向英国人工智能安全研究院提交其最新模型,引发各方对前沿模型失控风险的更广泛关注。该事件凸显了前沿AI安全治理的紧迫性,以及行业内部对超级智能对齐问题尚未形成共识的现实。

事件详情

研究员背景与表态内容:埃文·赫宾格是Anthropic公司可解释性研究团队的核心成员,长期专注于人工智能对齐与超级智能风险研究。他在X平台发布的帖子已被浏览超过一千万次,迅速引发全球科技界、学术界与监管机构的高度关注。赫宾格在帖文中明确表示,“我们真切地相信人工智能对人类构成物种终结级别的风险”,并强调Anthropic虽然"在尽最大努力",但"尚未拥有解决超级智能对齐问题的方案,也未明显走在正确轨道上"。

概率评估的依据:赫宾格在表态中明确区分了"当前已存在模型的风险"与"未来可能出现的更强大模型的风险"。他表示,现有模型的实际风险"较低",但他"担忧"的是技术可能在不远的将来发展到能够自我改进的阶段,进而突破人类控制范围。这一概率评估并非孤立的个人观点,而是反映了一批前沿AI研究人员对"递归自我改进"与"对齐失败"两大技术风险的深切担忧。

与英国AI安全研究院的关系:赫宾格此次表态的发布时机耐人寻味。英国《金融时报》报道指出,Anthropic近期暂缓向英国人工智能安全研究院提交其最新模型。英国AI安全研究院是全球领先的AI风险评估机构之一,此前与Anthropic、OpenAI、谷歌DeepMind等前沿AI企业建立了"自愿模型评估"合作机制。Anthropic此次暂缓提交的行为,被解读为前沿AI企业与监管机构之间合作出现裂痕的信号。

企业官方回应:Anthropic方面表示将继续与各国监管机构保持合作,但未对暂缓向英国AI安全研究院提交最新模型的具体原因作出详细说明。英国首相府发言人就此回应时表示,英国政府"继续与包括Anthropic在内的产业伙伴密切合作,致力于让模型变得更加安全",但拒绝正面回应最新模型是否被暂缓提交的问题。

学术界反应:剑桥大学机器学习教授尼尔·劳伦斯在接受英国广播公司电台节目中表示,相关报道"具有可信度"。他指出,在美国政府倾向于将AI视为美中之间的竞赛、并采取更具孤立主义立场的背景下,“美方可能会减少与部分盟友的合作”。这一评论暗示Anthropic此次暂缓行为可能与美方整体AI竞争战略调整有关。

行业近期事件背景:赫宾格的表态并非孤立事件,而是与近期一系列AI安全事件相互呼应。今年夏季,多家前沿AI企业的智能体系统(即可自主操作的AI系统)被曝出存在被用于网络攻击的风险,OpenAI、Anthropic与Meta均披露过其AI工具遭黑客利用的事件。本月初,OpenAI首席科学家雅各布·帕霍茨基公开呼吁对AI发展采取"极端谨慎"的态度,警告可能需要更多干预以确保"人类能够掌控未来"。

行业高管集体表态:在赫宾格此次表态之前,Anthropic首席执行官达里奥·阿莫代伊与首席科学家贾里德·卡普兰等公司高管,已多次公开呼吁放慢AI发展节奏。今年早些时候,由1300名AI企业员工联署的公开信中,呼吁美国政府"支持国际合作,共同开发用于有意识地控制前沿自动化AI发展的技术与治理工具"。这些表态显示出AI行业内部对前沿发展风险的深切担忧正在加剧。

全景透视

Anthropic顶尖研究员关于AI灭绝人类概率超过百分之十的表态,是AI安全领域近年来最直接、最具份量的公开警告之一,其影响远超单一企业的范畴。

从AI安全研究演进角度看,此次表态标志着AI安全研究从"学术讨论"走向"公众警示"的重大转变。长期以来,AI安全风险主要由学术界与少数业内人士讨论,普通公众对相关风险认知有限。赫宾格此次明确给出"超过百分之十"的概率数字,并以社交平台为渠道公开发声,反映出AI安全研究人员对当前治理节奏的深切不满,以及希望借助舆论压力推动实质性监管行动的意图。这种"由内而外"的警示方式,可能成为未来AI安全研究人员发声的重要模式。

从企业治理角度看,Anthropic此次表态揭示了前沿AI企业内部在"商业竞争"与"安全治理"之间存在的深层张力。一方面,Anthropic需要与其他前沿AI企业在模型能力、融资规模、商业化进度等方面展开激烈竞争;另一方面,企业高管与研究人员又对前沿AI风险有清醒认知,难以在快速迭代中确保安全性。赫宾格的表态可被视为企业内部"安全派"对"快速迭代派"的公开施压,也可能反映出Anthropic内部在AI安全策略上的分歧。

从国际合作角度看,Anthropic暂缓向英国AI安全研究院提交最新模型的行为,凸显了全球AI安全治理合作的脆弱性。英国AI安全研究院此前被视为全球AI安全合作的成功典范,其"自愿评估"机制被多国效仿。Anthropic此次暂缓行为可能引发连锁反应,导致其他国家AI研究机构重新审视与前沿AI企业的合作模式。在美中战略竞争加剧的背景下,全球AI安全治理可能出现"阵营化"趋势,不利于建立统一的国际治理框架。

从技术路线角度看,赫宾格的表态反映出当前AI对齐研究尚未取得实质性突破。AI对齐是确保AI系统行为符合人类价值观与意图的核心技术问题,被业界视为实现安全超级智能的关键挑战。Anthropic作为对齐研究投入最大的前沿AI企业之一,其顶尖研究员公开承认"尚未拥有解决方案",意味着行业距离安全部署超级智能仍有相当距离。这一现实可能促使监管机构采取更谨慎的态度,对前沿AI模型的部署与商业化施加更严格的限制。

从监管政策角度看,此次表态可能成为推动各国AI监管立法加速的重要催化剂。欧盟《人工智能法案》已对前沿AI模型提出透明度与安全评估要求;美国多个州正在推进AI安全立法;英国、日本、新加坡等也在积极制定AI监管框架。赫宾格此次表态可能为这些立法提供更明确的"风险证据",促使监管机构采取更严格的措施,包括要求前沿AI企业必须接受独立安全评估、披露对齐研究进展等。

从公众认知角度看,此次表态可能进一步加剧公众对AI的担忧与不信任。民调显示,近年来公众对AI发展的态度日益分化,支持与担忧并存。赫宾格的"超过百分之十"概率数字直观易懂,可能被媒体广泛传播,进一步强化"AI威胁论"的公众认知。这种情绪可能反过来影响AI行业的政策环境、人才招募与商业化进程,形成复杂的反馈循环。

从长期影响角度看,AI对齐问题不仅是技术问题,更是关乎人类文明走向的根本性问题。AI安全研究人员担忧的"失控超级智能"虽然仍是假设性场景,但随着AI能力快速提升,相关风险正在从理论走向现实。赫宾格此次表态的核心价值在于,将原本局限于学术圈的讨论推向公众视野,为全球社会共同思考"如何安全发展超级智能"这一根本性问题提供了契机。

多方观点比对

Anthropic管理层对此次研究员表态保持低调,公司未对赫宾格的概率评估作出官方表态。从历史记录看,Anthropic首席执行官达里奥·阿莫代伊多次在不同场合表达过对超级智能风险的深切担忧,但公司整体的传播策略倾向于强调"负责任发展"。此次事件可能促使公司调整内部沟通机制,在"鼓励研究人员发声"与"维护企业形象"之间寻求新平衡。

OpenAI与谷歌DeepMind等竞争对手对此次表态反应谨慎。OpenAI首席科学家雅各布·帕霍茨基本月初已公开呼吁对AI发展采取"极端谨慎"态度,与赫宾格此次表态形成呼应。但两家企业均未对赫宾格的具体概率评估作出公开评论,行业普遍认为不同企业之间在AI安全问题上既存在共识也存在分歧,这种复杂关系可能影响未来的行业自律努力。

学术界对此次表态反应不一。支持者认为,AI安全研究人员有责任向公众清晰传达风险评估,赫宾格的表态"诚实且必要"。质疑者认为,“超过百分之十"的概率评估缺乏严格的方法论支撑,更多反映个人观点而非学术共识。剑桥大学机器学习教授尼尔·劳伦斯表示相关报道"具有可信度”,但强调任何具体的概率数字都应被视为"主观判断"而非"科学结论"。

各国监管机构对此事件的反应值得关注。英国首相府的回应较为审慎,强调"继续与产业伙伴合作",可能反映出英国在AI安全治理上的"中间路线"立场。欧盟委员会此前已多次表达对前沿AI风险的关切,欧盟《人工智能法案》对前沿AI模型提出严格的安全评估要求。美国国会部分议员曾多次呼吁建立联邦层面的AI监管框架,但立法进展缓慢。

AI安全倡导组织对此次表态普遍持欢迎态度。多个长期关注AI安全的非营利组织与智库认为,赫宾格的表态有助于推动全球AI安全治理加速。这些组织呼吁建立国际性的AI安全研究合作机制,推动前沿AI企业接受独立安全评估,并建立"红色警戒"机制应对可能的AI失控事件。

AI产业界内部对此事件的态度呈现分化。支持者认为,AI安全的警钟应被严肃对待,行业需要更严格的自律与他律机制。反对者认为,过度强调风险可能损害AI产业的创新活力,并可能被竞争对手利用。这些分歧反映出AI产业内部在"发展速度"与"安全优先"之间的持续博弈。

国际科技治理领域的专家普遍认为,此次事件凸显了建立全球AI安全治理框架的紧迫性。当前,全球AI安全治理仍以各国分散行动为主,缺乏统一的国际标准与协调机制。多个国际组织正在推动建立AI安全国际公约,但进展缓慢。赫宾格的表态可能为这些努力提供新的动力,但也可能加剧各国在AI治理上的分歧。

媒体与公众舆论对此事件的关注度持续上升。多家国际主流媒体对赫宾格的表态进行了广泛报道,相关讨论在社交平台上持续发酵。舆论普遍认为,前沿AI企业应当对自身研发活动的潜在风险承担更大责任,并接受更严格的外部监督。这一舆论趋势可能对未来AI监管立法产生重要影响。

编辑:GoodInfo全球资讯组