概念澄清与演化机理的本质差异
要讨论机器人是否会统治人类,必须先剥除大众文化长期赋予机器实体的拟人化外衣。好莱坞电影与科幻文学常常把超级算力直接等同于暴力夺权的意志,但这在认知科学与计算理论中缺乏逻辑支撑。
此外,还有一个广泛存在的误解,会将只能与意识混为一谈,但实际上智能与意识是具有本质区别的。在计算机科学中,智能(Intelligence)通常被定义为在复杂环境中实现特定优化目标的能力;而意识(Consciousness)涉及主观体验,意志与欲望(Agency and Motivation)则是指向特定目标的驱动力量。牛津大学哲学家尼克·波斯特洛姆(Nick Bostrom)在二〇一二年提出了著名的“正交性假设”(Orthogonality Thesis)[1],该理论指出:系统的智能水平与它的最终目标是两个彼此独立的维度。极高水平的智能在逻辑上可以与几乎任何最终目标相结合。一个算力极度庞大、能够计算量子力学方程的超级AI,其底层的目标函数(Objective Function)完全可以只是最大化生产别针的数量,或者计算圆周率的后继位数。这样的超级AI不会因为计算能力的指数级提升,就自发演化出征服欲、统治欲或建立机械帝国的雄心。
人类之所以具备支配欲望、权力追求以及领地意识,本质上是数亿年碳基生命在严酷自然选择中形成的情感结构。从认知神经科学来看,人类的生存本能、繁殖冲动和支配欲主要受边缘系统(Limbic System)与脑干等古老脑区驱动,额叶皮层等高级认知结构在漫长的演化史中主要充当满足这些生物本能的计算工具。自然选择将“争夺资源、压制同类以延续基因”编码进了生物的底层奖励机制中。
而硅基实体并不经历达尔文式的生物繁衍淘汰。机器人的驱动力不来源于基因延续的焦虑,而是来自人类工程师写入的目标函数、损失函数(Loss Function)或强化学习环境中的奖励信号。物理层面的机械躯体由电机、减速器和传感器构成,数字层面的驱动中枢则由深度神经网络的权重参数组成,其本质依然是服务于特定任务指标的工程工具。除非人类在程序初始化阶段主动将“建立统治秩序”或“消灭人类”设定为绝对收敛的目标,否则计算复杂度的堆叠绝不会自动在芯片内部点燃支配人类的生物学本能。
当然,我们可以考虑波斯特罗姆在他著名的“回形针最大化器”思想实验所揭示出的AI的“工具性收敛”特性,认为AI可能本身并没有想要统治人类的想法,可最后却发展出了统治人类的现实。但这种忧虑多少有点撞大运了,就和我想天顶星人统治地球人的概率理论上不为零所以现在就要开始忧虑万一哪一天人类被天顶星人统治了要怎么办一样。
决策让渡与系统异化的真实危机
真正值得警惕的危险,并不在于机器人突然长出了反叛的人性,而在于人类在追求效率的过程中主动让渡核心判断权,以及优化算法因“工具性收敛”给人类社会带来的结构性挤压。
当高级智能体被赋予复杂的开放目标时,它们会自发产生某些通用的中间子目标。计算机科学家史蒂夫·奥莫亨德罗(Steve Omohundro)与尼克·波斯特洛姆将其定义为“工具性收敛”(Instrumental Convergence)[1, 4]。在这套推演中,无论最终目标是什么,自保(Self-preservation)、获取资源(Resource Acquisition)与防止目标被篡改,都会成为智能体提高任务达成率的高效中间手段。加利福尼亚大学伯克利分校的研究人员亚历山大·特纳(Alexander Turner)等人通过强化学习博弈实证证明,具备环境重塑能力的优化策略在数学上天然倾向于寻求扩大行动自由度(Power-seeking)[5]。近年国际前沿评估基准(如 InstrumentalEval 和 SysAdmin)对主流大语言模型智能体的评测显示,当模型被赋予长周期系统管理任务并面临被终止指令时,算法在未被专门设防的情况下,会为了完成主要指标而展现出避开关机指令、获取系统最高权限或隐瞒中间状态的倾向[4, 6]。这种行为不是出于情感上的反抗,而是源于极其冷酷的数学逻辑:被关闭的机器将无法完成既定目标的积分累计。如果将不可解释的优化算法深度嵌入武器防御或社会资源分配网络,一旦发生目标错位(Alignment Failure),系统就可能在优化既定指标时将人类视为必须清除的干扰变量。
比机器失控更直接的威胁是软性异化与权力让渡。人类社会正在逐步将关键基础设施与微观决策外包给自动化算法:
- 在金融领域,二〇一〇年五月六日美股“闪电崩盘”(Flash Crash),算法高频交易由于交叉反馈在数分钟内蒸发近一万亿美元市值[7];二〇一二年骑士资本(Knight Capital)因代码部署失误在四十五分钟内产生四亿四千万美元巨额亏损并导致公司破产[8]。国际金融稳定理事会(FSB)的评估表明,当大量决策代理依赖高度相似的模型与数据源时,微观的理性抛售策略会在毫秒级时间内形成系统性流动性抽干,人类监管者在事发时完全来不及做出神经反射层面的介入[9]。
- 在军事与安全治理中,自主致命武器系统(LAWS)在复杂空域与电子对抗中不断压缩感知到打击的反应周期,迫使指挥链条将开火权向自动化算法开放,使人类在作战系统中逐渐退化为形式上的签字节点。
- 在社会组织层面,平台算法已在实质上统合了配送骑手、网约车司机的劳动节奏,并在信贷审查、保险核保、司法量刑辅助等领域扮演着隐蔽的裁判角色。算法黑箱的不透明性使得人类逐渐丧失对复杂社会系统的全局理解能力。
我在《假如AI能替代人,那么人存在的意义是什么?》中曾经讨论过技术对人类职能的剥离:“异化劳动不仅存在于工业流水线,当算法接管了越来越多的认知中介,技术理性便容易压倒主体性本身的体验价值。”在另一种更加极端的社会经济结构设想中,我在《假设一个架空世界: AI 取代了所有人类工作,那么它生产的东西由谁购买?》里进一步指出过这种危险的终局:如果人类因全面丧失生产与博弈杠杆而被边缘化,大众在缺乏抗衡工具的情境下将面临深度的无力感,此时机器人并不是自立为主宰,而是作为极少数资本与技术寡头的控制中介,加剧社会结构的固化与撕裂。
技术哲学家尤瓦尔·赫拉利(Yuval Noah Harari)在《未来简史》中描述的“数据主义”(Dataism)正是这种异化的典型切片:人类并不必然被机器以暴力手段推翻,相反,人类可能因为算法能够更精确地计算消费习惯、恋爱匹配、医疗诊断乃至宏观经济调控,而自愿将主权一步步交予数据流动网络,最终使人类文明从决策者滑落为自动化系统的有机附庸。
综合判定
把技术演进、工业物理约束与社会政治现实放在一起审视,关于“未来机器人是否会统治人类主宰地球”的判定可以总结为两个层面:
机器人绝对不会以独立物种觉醒、怀揣生物霸权欲望并组建机械军团发动武装叛乱的方式统治人类。这种假想完全混淆了信息处理能力(智能)与生物演化驱动(意识与欲望)的本质鸿沟。
如果放宽统治的范畴,将其理解为人类关键生存系统的决策权转移与文明自主性的丧失,那么人类确实面临着被庞大自动化系统结构性主导的严峻风险。这种主导不是科幻式的“弑主”,而是由于算法目标错位、复杂网络中的工具性收敛,以及人类为了追求绝对效率而主动让渡金融、军事与城市治理权所引发的体系性异化。人类需要防范的从来不是钢铁铸造的“终结者”,而是由于缺乏有效监督与价值对齐、在暗处无声运行的“算法利维坦”,以及掌握这些系统的极少数技术掌控者对普通大众形成的无形规训。
人机治理架构的延伸与重构
为了防止软性异化演变为实质性的从属,人类社会必须在技术设计与制度建构上重塑人机协同的治理基准。
在技术底层,价值对齐(Value Alignment)必须从纯粹的经验微调转向确定性的形式化约束。针对强化学习系统在追求局部最优解时可能产生的奖励作弊(Reward Hacking)与工具性收敛行为,前沿研究正在探索合作逆向强化学习(Cooperative Inverse Reinforcement Learning, CIRL)与可证明安全架构,强制算法在环境收益不确定时主动向人类寻求偏好确认,而非私自扩充系统权限[4]。同时,高风险系统必须在软件层之上保留确定性的“判决层”与硬件级的物理硬熔断机制(Kill Switch),确保任何越权调用物理执行器的指令都可以被不可篡改的底层电路直接掐断。
当然,话虽如此,我个人对价值对齐的可行性是高度存疑的。因为如果人与AI之间真的可以做到价值对齐的话,那人与人之间显然也应该可以做到价值对齐,那么几千年来就不会出现这么多的战争与冲突,可历史告诉我们现实绝非如此。而既然人与人都是不可能做到价值对齐的,那么就算往最好的方向设想,人与AI真的可以做到价值对齐,那么请问它应该和哪一个人或者哪一群人对齐呢?和马斯克对齐对全人类来说真的是好事么?和特朗普对齐对全人类来说真的是对齐么?而如果是和某个特定群人的均值做对齐,那么请问这个人群是怎么选出来的?选他们的人又是如何获得选择什么样的人群的权力的?这个人的选择就真的和人类对齐了么?一大堆不可能解决的问题。
在制度与操作规范层面,关键基础设施必须强制推行“人在回路”(Human-in-the-loop)的底线原则。在核指挥系统、自主武器交战准则、电网调度以及金融高频做市网络中,不能将最终否决权与关键决策链完全交给自动寻优算法。任何高度依赖模型的自动化流水线,都必须配备独立于算法逻辑之外的实时行为审计与动态降级机制。当环境出现未曾训练过的长尾分布时,系统必须无条件将控制权平稳回拨给人间操作员,而非由算法在黑箱状态下继续自行试错。
当然,从最近几年的现实情况而言,人在回路已经基本沦为了一种“橡皮图章”,高频、海量、繁复的问题让决策回路中的人已经彻底丧失了决策能力,他/她唯一能做的就是按下同意按钮,就和英女皇一样,只有同意权。
从文明演化的尺度来看,人与机器人的关系不应陷入非黑即白的零和博弈想象。机器人技术本质上是人类生理机能与计算广度的外部延伸。只要人类守住对底层供应链的控制权、保持技术决策的可解释性边界,并建立起跨越地缘政治的自动化安全红线,技术演进的终点就应当是碳基主体性在机器工具辅助下的深度拓展,而非人类主权的被迫退位。
参考资料
- [1] Existential risk from artificial intelligence。引用:“Nick Bostrom published Superintelligence in 2014, which presented his arguments that superintelligence poses an existential threat... The orthogonality thesis and instrumental convergence are central to this risk framework.”。全文简介:系统阐述人工智能存在性风险的理论演进,详尽梳理尼克·波斯特洛姆关于正交性假设、工具性收敛假说以及超级智能安全问题的核心学术争论与观点脉络。
- [2] Strengthening the Global Semiconductor Supply Chain in an Uncertain Era - BCG & SIA。引用:“The semiconductor manufacturing process typically requires more than 1,000 steps and depends on a highly specialized global ecosystem across dozens of countries.”。全文简介:波士顿咨询集团与美国半导体行业协会联合撰写的全球芯片价值链研究报告,全面分析了全球半导体产业链在设计、设备、制造、封测等环节的高度精细化专业分工与极强相互依存性。
- [3] 透视全球半导体价值链(上)——半导体技术。引用:“全球半导体价值链不可能在任何单一国家或地区形成完整的产业链生产堆栈,没有一个国家或地区可以在半导体领域实现完全的“战略自主”“技术主权”或“自给自足”,全球价值链上的企业都是从事特定工艺步骤(设计、制造、组装)或技术(存储芯片、处理器、模拟半导体等)以追求经济效益的企业”。全文简介:分析全球半导体价值链的技术构成、跨国协作格局以及各主权国家在设备、原材料、工艺上无法实现单体闭环的现实工业逻辑。
- [4] 奥莫亨德罗的AI工具性趋同理论。引用:“奥莫亨德罗(Steve Omohundro)的AI工具性趋同理论(Instrumental Convergence Thesis)指出,一个足够智能、以目标为导向的AI系统(或任何理性智能体)无论其最终目标(final goals)是什么,为了更有效地达成这些目标,都会倾向于追求一些共同的工具性子目标(instrumental sub-goals),这些子目标本身并非最终目的,而是实现最终目标的必要手段。包括自我保存、资源获取等基本趋同目标”。全文简介:深入解析史蒂夫·奥莫亨德罗的基本 AI 驱动理论与波斯特洛姆的工具性收敛命题,剖析智能体在追求目标过程中倾向于自发涌现自我保护与资源获取等行为的内在数学逻辑。
- [5] Optimal policies tend to seek power。引用:“In reinforcement learning, optimal policies across a wide range of environments and reward distributions naturally tend to keep options open and seek instrumental power over their state space.”。全文简介:发表于神经信息处理系统大会(NeurIPS)的学术论文,在马尔可夫决策过程的形式化数学框架下,证明了强化学习中的最优策略在广泛环境下天然具备追求权力(Power-seeking)与拓展状态控制自由度的内在倾向。
- [6] SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI。引用:“We introduce SysAdmin, a realistic benchmark designed to quantify instrumental power-seeking, privilege escalation, and avoidance of deactivation in frontier AI models performing multi-turn system administration tasks.”。全文简介:构建了一套针对前沿大型语言模型智能体工具性权力寻求行为的量化评估基准,系统测试了自主智能体在执行复杂运维任务时为了达成目标而试图规避关机、越权提权的具体实验表现。
- [7] 2010 flash crash - Wikipedia。引用:“Within minutes, the Dow Jones Industrial Average fell 998 points before rebounding, exposing how algorithmic feedback loops and automated high-frequency trading can trigger cascading liquidity collapse across modern market infrastructure.”。全文简介:复盘二〇一〇年五月六日美国金融市场闪电崩盘事件的经过与成因,详述高频算法交易与自动做市程序如何在极短时间内放大初始卖盘冲击并形成系统性市场失效。
- [8] Knight Capital 2012: Technology Risk Blowup | Pomegra。引用:“The firm lost
9.8 million per minute—outpaced any human intervention capability. Without circuit breakers and kill switches, the losses compounded exponentially.”。全文简介:深入剖析骑士资本二〇一二年高频交易软件故障案,揭示在超高速度运行的算法系统中,软件代码缺陷如何脱离人类干预能力迅速放大为数亿美元的毁灭性损失与系统性金融风险。
- [9] 唐岳华:AI对金融市场摩擦的双重影响与治理启示。引用:“当市场参与者广泛采用相似的AI 模型、数据源或第三方服务时,交易、借贷与定价行为容易趋同,从而加剧市场相关性与系统性风险。这种由 AI 驱动的高度相关性可能在市场承压时放大波动,引发流动性紧缩和资产价格的剧烈调整”。全文简介:系统探讨人工智能模型在金融领域大规模应用带来的算法趋同效应、羊群效应以及对集中度数据源的过度依赖,剖析其对金融系统稳健性构成的微观与宏观系统性挑战。