沙泽尔——AI 时代“炼金师”

沙泽尔

导语

如今我们随手使用的 AI 聊天机器人、图文视频生成工具、机器翻译软件,背后都共享同一套底层技术框架。这套彻底改写人类人工智能发展轨迹的体系,诞生于 2017 年谷歌一间普通的办公室,由八名研究者联手撰写的划时代论文《Attention Is All You Need》奠定根基。业内早已形成共识:若无诺姆·沙泽尔(Noam Shazeer)的关键突破,这项足以颠覆整个人工智能领域的技术,只会停留在无法落地的纸面猜想,永远难以走出实验室。

他是全球顶尖的国际数学竞赛满分金牌得主,24 岁跻身谷歌初代二百号内核心员工之列,亲手搭建谷歌搜索、谷歌广告两大核心业务的底层算法体系;中年时期,他一举破解困扰人工智能行业数年的技术死局,铸就所有大模型赖以生存的基础逻辑;后因技术理念分歧告别科技巨头自主创业,打造千万级用户 AI 产品,又被谷歌以 27 亿美元重金召回,却在 2026 年再度转身,加盟 OpenAI 深耕下一代通用智能。

在外人眼中,他是天赋卓绝、辗转各大顶级科技巨头的传奇技术大神;但在同事与家人眼中,他只是一个痴迷数字逻辑、不谙世俗人情、始终坚守“让技术惠及普通人”初心的纯粹研究者。

本篇将从家庭底色、少年成长、大学巅峰、谷歌二十年浮沉、创业风雨、性格特质、行业趣闻与长远行业影响八大维度,完整梳理沙泽尔的人生轨迹,立体还原这位 AI 时代底层奠基人的传奇人生与精神底色。

第一章 犹太家庭的数字启蒙:一个天生就和数字对话的孩子

1976 年,诺姆·沙泽尔出生于美国费城的犹太移民家庭。其祖辈为躲避二战犹太人大屠杀,辗转苏联、以色列多地,最终定居美国。这个家庭并无丰厚财富,却沉淀出独树一帜的思维底色:理性思辨、尊崇逻辑、求真务实,同时兼具温暖的人文信仰。

1.1 父亲:“任何问题不要盲目试做,先从底层规律推导答案”

沙泽尔的父亲曾任职中学数学教师,后转型为硬件工程师,常年深耕电路研发与数字计算领域。不同于多数家长强迫孩子刷题应试,他的教育方式极具巧思,重在启发思维、培养逻辑。

闲暇之余,父子二人从不会伏案刷题,而是以数字谜题、逻辑桌游为乐。街头散步时,父亲会随手抛出趣味数学问题:“街边有 5 家店铺,两两之间修建小路,一共能修多少条?”“一堆硬币,仅称重三次,如何精准找出重量异常的那一枚?”

在电子娱乐匮乏的童年时代,数字推理便是沙泽尔最热衷的消遣。正是父亲的启蒙,让他养成贯穿一生的核心思维习惯:遇到问题切勿盲目试做,先从底层规律推导本质答案。这套思维体系,日后成为他破解人工智能无数核心技术难题的终极利器。

沙泽尔的母亲是温和包容的全职主妇,从不强迫孩子迎合世俗标准。年少的沙泽尔不喜同龄人打闹嬉戏,常常独自静坐推演数理逻辑,母亲始终予以理解与支持,为他购置大量数学科普书籍与逻辑谜题集,守护他的天赋与热爱。

他的姐姐成年后成为犹太拉比,深耕人文精神领域。一个家庭,一端是极致理性的数理逻辑,一端是温润厚重的人文情怀,两种特质交融共生,塑造了独一无二的沙泽尔。他既能冷静拆解复杂的数学公式、攻克硬核技术难题,也始终共情人类情感、重视人际沟通,这也是多年后他执着研发通用对话 AI、追求人机温情交互的深层渊源。

1.2 少年时代:“独自推导完整解题逻辑”

小学阶段的沙泽尔,便彻底区别于普通学生。课堂上老师讲解固定解题模板,全班同学照搬套用,唯有他会举手质疑:“解题步骤的底层逻辑是什么?是否存在更简洁的推导方式?”

小学老师曾回忆,多数孩子遭遇难题要么求助、要么放弃,唯独沙泽尔能够对着草稿纸独立思考数小时,直至完整推导出专属解题逻辑。他极度排斥死记硬背,所有数理公式、定理结论,必先亲自从头推导证明,方才认可接纳。

升入初中后,校内常规数学课程已无法匹配他的学习进度。学校为其开放专属图书馆权限,允许他自主研读高中乃至大学低年级数理教材。当同龄人课余休闲娱乐时,他的书包里始终装满数论、组合数学等高阶专业读物。

少年时期的他不善社交、不屑迎合他人,也不在意世俗眼光。在同学眼中,他孤僻沉闷、格格不入,唯有谈及数字与逻辑时,才会变得滔滔不绝。这份纯粹专注、不喜应酬的特质,贯穿了他的学生时代与职业生涯。

1.3 高中封神:“吃透一类问题数学本质”的金牌得主

高中阶段,沙泽尔迎来人生首个顶级高光时刻——入选美国国家队,征战 1994 年香港国际数学奥林匹克竞赛。这项赛事汇聚全球各国顶尖高中生,整套试卷涵盖几何、数论、组合、代数四大核心板块,满分 42 分,历年能斩获满分者寥寥无几,是全球高中生数理能力的最高试炼场。

而他少年生涯最史诗、最传奇的成就,正是诞生于这场赛事。1994 年香港奥数比赛创下百年未有的空前纪录,美国代表队六名参赛选手全员满分、全员斩获金牌,沙泽尔正是这支传奇“奥数梦之队”的核心成员。纵观国际奥数近百年史册,从未有任何一支国家队达成全员满分的极致战绩,这一纪录至今无人复刻、无人超越。喜讯传回费城,学校乃至整个本地犹太社区为之沸腾,少年沙泽尔的天才之名,自此响彻全美。

不同于多数奥数选手依靠题海战术、背诵题型模板应试,沙泽尔的备赛逻辑截然不同。他从不沉迷刷题,而是深耕数理底层逻辑,拆解每一类题型的本质规律,举一反三、融会贯通。他的教练曾精准评价:“普通选手学会的是一道题,沙泽尔吃透的是一类问题的数学本质。”

这场顶级赛事的历练,让他彻底夯实线性代数、概率分布、组合拆分三大核心数理功底,而这三类底层知识,正是多年后他突破人工智能多项核心技术瓶颈的关键密钥。

凭借奥数金牌的顶级成绩与扎实的数理功底,全美多所顶尖名校纷纷向他抛出全额奖学金橄榄枝。最终,他选择杜克大学,攻读数学与计算机双学位。杜克大学作为媲美常春藤的美国顶级名校,数理与计算机本科教学实力顶尖、生源门槛极高,能获该校顶级全额奖学金招录,足以印证沙泽尔超乎常人的天赋。

第二章 杜克大学四年:北美本科生数学天花板,拒绝套路的天才

1994 年,18 岁的沙泽尔踏入杜克大学,开启四年本科生涯。在这里,他登顶北美本科生数学竞赛最高舞台,带队创下校史数十年最佳战绩,同时打通数学与计算机的交叉边界,为日后深耕人工智能底层领域埋下关键伏笔。

2.1 跳级上课,全额奖学金加持的顶尖新生

入学之初,数学系导师仅通过简单测试,便判定沙泽尔的数理水平远超大一新生水准。校内全部大一微积分、基础代数等核心课程全部免修,直接跳修大二、大三高阶专业课程,开启越级学习模式。

杜克数学系为其授予专属数学的全额专项奖学金,当年全校仅三名新生获此殊荣。在校期间,学校全额覆盖学费,并发放月度生活补贴,为他隔绝外界干扰,保障其全身心深耕学术、钻研数理。

他主修纯数学与计算机科学双方向,深耕组合数学、概率统计、高等线性代数等核心领域。不同于多数学生割裂两门学科的学习模式,他早早确立核心认知:数学是解决问题的底层工具,计算机是落地实践的核心载体,二者深度融合,方能破解现实世界的复杂难题。

课余时间,他自主钻研统计语言建模,尝试用数理逻辑模拟人类文字表达规律。这一在 90 年代极为冷门的研究方向,恰好精准契合十余年后大语言模型的核心赛道,彰显其超前的学术敏锐。

2.2 普特南竞赛:北美本科数学最高舞台,连续三年稳居全国前 20

普特南数学竞赛是全球公认难度最高的本科生数理赛事,每年汇聚两千余名北美数学顶尖学子参赛。赛事评分严苛,多数参赛者总分不足 10 分,能稳居全国前 20 名,便能享誉奇才之赞。沙泽尔连续三年参赛,战绩次次封神、稳居顶尖。

大一(1995 年):全国第六名,拿到“准院士”荣誉

以新生身份闯入全国前十,在普特南赛事史上极为罕见。当年两千余名参赛者中,仅前十选手可获评最高荣誉“普特南院士”并斩获专项奖金。杜克校报专程报道其传奇战绩,全校师生方才知晓校内迎来一位数学奇才。彼时众多高年级学长的得分都远不及他,教练直言:“大一能达到这一高度,杜克校史前所未有。”

大二(1996 年):个人稳居全美前十、全队最高分,带队拿下全国团队总冠军

该年赛事仅前五名获评最高荣誉“普特南院士”,沙泽尔位列全美 7 至 10 名,斩获专项奖金,也是杜克校队唯一闯入全美前十的选手。凭借他的核心发力,杜克大学总分强势超越哈佛、普林斯顿等顶尖名校,拿下全国团队总冠军。赛中所有高难度的组合、矩阵类压轴难题,均由他完成核心推导,是队伍夺冠的绝对核心支柱。不仅如此,他还主动承担学生教练职责,课余组织队员复盘题型、总结通用解题逻辑,全方位带动校队整体实力提升。

大三(1997 年):全国第二十名,带领队伍拿下全国亚军

当年参赛规模扩容至两千五百余人,竞争愈发激烈,沙泽尔依旧稳居全国前 1%顶尖梯队,带领杜克校队拿下全国亚军。三年普特南征程,他带队斩获冠、亚两项大奖,缔造杜克大学 90 年代的数理黄金时代。

对比同期参赛选手,多数人依赖固定解题模板应试刷题,沙泽尔始终坚守“先推导原理、再落地实操”的核心思维。这套极致严谨的研究范式,贯穿了他日后所有技术研发工作。

2.3 跨学科实践:用概率匹配破解填字游戏

本科跨学科研讨课上,导师布置核心课题:依托统计逻辑编写程序,实现英文填字游戏自动破解。沙泽尔作为项目核心负责人,主导全程研发工作。

他海量收录英文文本词汇与语句规律,依托概率统计搭建精准匹配模型,让计算机自主推演、精准匹配空格对应单词。这场看似普通的课堂实践,锤炼了三大核心能力:海量文本数据处理、概率分布精准计算、序列文字智能匹配,恰好对应日后机器翻译、AI 对话大模型的底层核心逻辑。

这次实践让他彻底锚定人生科研方向:以数学为根基、计算机为载体,让机器读懂人类的语言逻辑。90 年代人工智能尚处于萌芽阶段,业内研究者多聚焦简单图像识别,极少深耕文本语言赛道,而沙泽尔早已提前布局,锁定未来十年 AI 核心发展方向。

2.4 本科毕业,放弃直博,奔赴伯克利读硕研

1998 年,沙泽尔顺利斩获数学、计算机双学士学位。凭借碾压级的竞赛成绩与学术积淀,多所顶尖名校向他抛出直博邀约,他却毅然选择前往加州大学伯克利分校,攻读计算机硕士,深耕语言概率建模与文本统计领域。

但硕士学业尚未完成,他便收到谷歌重磅邀约,果断选择退学入职,奔赴产业前沿。

第三章 谷歌初代员工:互联网商业底层架构的搭建者(2000-2011)

2000 年,谷歌创立仅两年,尚处于初创崛起阶段,全公司仅有 200 名核心员工。沙泽尔放弃硕士学业,正式入职谷歌,成为初代核心工程师。世人多熟知他的 AI 奠基人身份,却鲜少知晓:谷歌能够称霸全球搜索与数字广告市场,核心根基源自他早年搭建的底层算法体系。

值得一提的是,沙泽尔并非通过常规的社会招聘入职谷歌,而是凭借极致的数理天赋与工程实操能力,被高层破格吸纳。时任谷歌 CEO 埃里克·施密特对其极为赏识,曾在斯坦福公开演讲中直言:“如果全世界有任何人能够实现人类级别的通用人工智能,那一定是沙泽尔。”这份顶级认可,让他在谷歌初创阶段拥有充足的自由研究权限与专属算力资源。

3.1 首个项目:改写全球搜索输入的拼写纠错

互联网发展早期,搜索引擎存在致命痛点:用户输入错别字、语序偏差,搜索结果便会完全跑偏,且无任何纠错提示。当时谷歌已有工程师着手研发纠错工具,恰逢负责人休假,这一关键项目临时交由沙泽尔接手。

他依托大学深耕的概率统计、n 元文字统计知识,搭建全新智能匹配算法:海量收录全球网页文本词汇与搭配规律,精准比对用户输入内容,自动识别拼写偏差,弹出“你是不是要搜索 XX”的智能提示。

这套系统上线后,谷歌搜索用户体验实现质的飞跃,此后十几年始终是全球搜索引擎的标配核心功能。时至今日,各类搜索软件的智能拼写纠错功能,底层核心逻辑均源自沙泽尔的初代设计。

3.2 PHIL 算法:撑起谷歌广告收入的核心引擎

互联网早期,谷歌的核心营收支柱为网页广告匹配系统 AdSense,依托网页内容匹配对应广告实现商业化。沙泽尔独立研发设计 PHIL 广告定向匹配算法,能够精准解析网页文本主题、匹配对应广告资源,实现高效精准的商业化推送。

在尚无人工智能大模型的时代,这套纯统计算法实现了高精度内容匹配,撑起谷歌早期绝大部分营收,是企业商业化崛起的核心根基。谷歌高管后续复盘坦言:若无沙泽尔这套广告底层系统,谷歌的商业扩张速度与行业地位都将大打折扣。

3.3 人类首个万亿词汇文本统计模型

2007 年,沙泽尔与谷歌传奇工程师杰夫·迪恩联手,训练出人类首个万亿词汇规模的文本统计模型。团队海量收录全球网页文本数据,精准记录词汇搭配、出现概率与语义关联,落地应用于搜索智能补全,同时也成为机器翻译领域的早期基础数据。

这个项目提前验证了人工智能核心规律:数据规模越大,文字模型的语义理解能力越强,也就是业内熟知的“大模型规模放大定律”。十余年后千亿、万亿参数大模型的核心研发思路,早在 2007 年便由沙泽尔提前落地验证。

3.4 谷歌早期十年生涯的缩影

这一时期的沙泽尔,完全不谙职场人情世故。会议之上只论技术逻辑、不谈人情关系,从不参与部门八卦、职级内卷;管理层多次为其提供管理岗晋升机会,均被他直接婉拒,始终专注于代码编写与数理推导。

同期同事曾评价:“他的世界里只有数字与代码,升职、加薪、头衔对他毫无吸引力,只要能拥有充足的算力与自由研究空间,他便能沉心深耕、日夜钻研。”

他极度淡泊名利,行业论坛、媒体专访、公开活动能推则推,常年深耕办公室、潜心钻研技术。这份极致低调的特质,即便在他做出颠覆行业的 AI 核心技术后,也始终未曾改变。

第四章 谷歌大脑团队九年:破解 AI 时代两大核心难题,奠定大模型根基(2012-2021)

2012 年,谷歌正式成立深度学习核心团队“谷歌大脑”,沙泽尔主动申请加入,正式深耕人工智能赛道。此后九年,他接连产出三项改写全球 AI 格局的颠覆性成果:稀疏专家网络、Transformer 全套核心数学优化体系、通用对话 AI 底层框架,每一项都成为当代人工智能所有产品的核心标配。

4.1 稀疏专家网络:解决 “大模型算力太贵” 的行业死局

2016 年,沙泽尔以第一作者身份发表重磅论文,首次提出稀疏门控专家网络技术,彻底破解大模型算力成本的行业死局。

以通俗逻辑解读:传统 AI 模型所有计算单元同步启动,模型参数规模越大,算力、能耗成本呈指数级暴涨,模型扩容陷入瓶颈。而稀疏专家网络技术,可将巨型模型拆分为多个独立子模块,系统仅激活与当前问题匹配的计算单元,其余模块静默休眠,大幅降低算力消耗。

这项技术实现了颠覆性突破:模型参数量可无限扩容,但单次推理算力消耗保持稳定,彻底解决了超大模型成本过高、无法全民普及的行业难题。如今全球所有万亿参数级超大型 AI 模型,均基于这套技术的迭代开发。

这项技术的核心设计思路,源自他本科时期深耕的组合拆分、概率加权数理思维,是纯数学理论落地超级工程的经典范例。

4.2 2017 年:半路入局,救活濒临失败的 Transformer 项目

2016 年末,谷歌另一支研究团队着手研发全新 AI 文本处理框架 Transformer,旨在彻底颠覆行业沿用多年的串行循环计算架构,实现全新的文本并行处理突破。

彼时行业存在致命技术痛点:传统 AI 处理文本需逐字逐行计算,无法并行运算,训练效率极低;对于长文本中远距离的语义关联、指代关系完全无法捕捉,导致翻译、问答、文本理解的效果始终存在短板。

该团队试图搭建一套可一次性读取整段文本、实现并行计算的全新架构,但历经半年反复实验,始终无法突破技术瓶颈:训练过程频繁出现数值失控、梯度爆炸、数据归零等问题,无论如何调参试错,模型都无法稳定收敛学习。项目一度濒临终止,管理层计划削减算力、叫停研发。

2017 年初,沙泽尔偶然路过该办公区,听闻团队研讨半年未解的训练崩溃难题。凭借极致的数理直觉与专业敏感,他瞬间判定问题根源出自底层数学计算逻辑,逐主动请缨加入团队,牵头优化核心架构。

当团队还在误区中撞行,沙泽尔却跳出表层调试,从线性代数、概率论底层原理完成完整理论推导,精准定位三大致命缺陷,一次性推出三组核心解决方案,铸就了现代 AI 赖以生存的三大底层基石:

1. 缩放计算平衡机制:文本的特征数值,会随句子长度递增无限放大,引发计算失控、数据崩溃;他新增一项极简的系数缩放公式,精准平衡控制数值区间,一举解决句子长度递增导致文本特征数值无限放大顽疾,彻底根治困扰团队半年的训练崩溃难题。

2. 多头注意力读取机制:将文本信息拆分至多维度独立通道同步进行分析,让模型可同时识别语序、指代、人物关系、语义逻辑等多重信息,全方位提升机器对文本的理解精度。

3. 三角函数位置编码:摒弃传统训练式位置记忆方案,依托三角函数固有周期规律,让 AI 自主识别文本语序、区分前后逻辑,无需额外训练即可精准捕捉词序信息。

除此之外,他优化网络层级归一化排布逻辑,解决多层网络叠加后的学习失效问题,重写整套底层运算代码,彻底夯实架构的稳定性。

短短三个月,这套濒临作废的注意力架构成功跑通落地,文本翻译精度一举超越全球所有同类 AI 模型,实现颠覆性突破。

八名研究者联合撰写重磅论文《Attention Is All You Need》,正式定名 Transformer 架构。团队特意标注署名随机排序、全员贡献均等,尽显科研协作精神。但业内公认,沙泽尔的数理优化方案,是整套架构从理论走向落地、稳定运行的核心基石。

论文投递至顶级学术会议后,初期并未被业界看好,三名审稿人普遍认为该架构仅适用于机器翻译场景,不具备通用拓展性,最终仅低分勉强录取。会议现场分享时,听众寥寥无几,无人预料到,这套架构将在数年后彻底颠覆全球人工智能格局,成为所有 AI 的统一底层骨架。

如今,豆包、ChatGPT、Claude 等对话大模型,AI 绘画、短视频生成、语音识别工具,蛋白质科研模型、高阶自动驾驶系统、代码编写审核程序,所有人工智能应用的底层核心架构,全部源自 Transformer 体系,而其中最关键、最核心的几项方案,均出自沙泽尔之手。

4.3 分布式超算训练系统:让超大 AI 模型能够批量训练

Transformer 架构落地后,沙泽尔迅速发现新的行业瓶颈:超大参数模型体量庞大,单台显卡无法承载完整训练任务,多设备协同计算时数据传输损耗极大、效率极低,严重制约大模型迭代升级。

为此,他主导研发网状分布式超算训练系统 ,将海量数据拆分至多显卡网格集群,实现分而治之的并行计算模式,大幅降低多设备通信损耗、提升训练效率。谷歌后续千亿级参数大模型、Gemini 多模态 AI 的训练落地,全部依托这套系统实现,这也是全球首款落地实用的巨型模型并行训练工具。

4.4 设计 T5 统一文本模型、轻量化处理技术、自适应优化工具、AI Meena/LaMDA 人机对话系统

此后数年,沙泽尔持续深耕 AI 底层优化,接连产出多项里程碑式技术成果,持续夯实行业根基:

1. 统一文本转换模型 T5:将翻译、写作、问答、摘要、分类等所有文本任务,统一转化为文本生成范式,奠定了当代提示词工程、指令微调、通用大模型的研发基础。

2. 多查询轻量化技术:大幅降低 AI 对话、推理过程的显存消耗,让普通电脑、移动设备也能流畅运行高性能大模型,推动 AI 轻量化普及。

3. 自适应优化工具:有效缩减大模型训练内存占用,解决千亿级参数模型训练的内存瓶颈,是超大模型迭代的必备核心工具。

4. 初代人机对话 AI Meena(迭代版是 LaMDA):全球首款支持超长多轮流畅对话的 AI 模型,具备长效上下文记忆能力,彻底突破早期 AI 对话碎片化、无记忆的局限,开启通用对话 AI 新时代。

沙泽尔始终全力推动这款对话 AI 向大众开放,他坚信成熟的 AI 技术应当走出实验室、惠及普通人。但谷歌管理层出于风险管控、商业收益等考量,持续推迟开放计划,双方理念分歧持续两年,最终成为他离职创业的核心导火索。

4.5 九年处事趣闻

1. 算力优先赋能科研:日常工作中,他优先将算力资源分配给搜索、翻译等核心业务,主动牺牲个人研发算力,常年利用夜间、周末闲置时段加班实验,凌晨核对数据,已是常态。

2. 谦和包容提携后辈:Transformer 项目研发期间,团队包含一名大三实习生,沙泽尔毫无前辈架子,耐心拆解底层数学逻辑、传授研发思路,全力扶持青年研究者成长。

3. 敢于颠覆行业陈规:当全行业默认“文本 AI 必须串行排队计算”的固有范式,唯有他敢于彻底推翻旧架构,拒绝在老旧体系上修修补补,以颠覆性思维重构 AI 底层逻辑。

4. 极简务实的工作风格:他极度排斥形式主义,开会从不用华丽 PPT,仅携带一页手写公式草稿,以严谨的数学推导拆解问题、论证方案,务实高效、直击核心。

第五章 愤然离职创业:打造千万级用户 AI 对话平台(2021-2024)

2021 年,沙泽尔与搭档丹尼尔多次向谷歌高层申请开放 LaMDA 对话 AI 系统,均遭到驳回。在他看来,成熟的前沿 AI 技术应当普惠大众、服务普通人,而企业管理层优先顾虑舆论风险与商业利益,二者核心理念彻底相悖。一次内部会议后,他毅然递交辞呈,直言:“你们根本不懂 AI 真正价值。”

5.1 从零创办 Character.AI 公司,为人人创造专属的 AI 角色

离职后,二人联手创立 Character.AI,打造全新普惠式 AI 对话平台。产品核心逻辑简洁纯粹:用户可自主定义 AI 的人设、性格、背景与风格,自由地与历史名人、动漫角色、原创虚拟好友进行沉浸式交互对话。

产品底层完全依托 Transformer 架构,搭配沙泽尔自研的超长记忆优化技术,让 AI 能够留存数十轮对话上下文,人设稳定、逻辑连贯、贴合设定,彻底解决早期 AI 对话碎片化、人设崩塌的痛点。2022 年测试版上线后,短短两月访问量翻四倍,上线 16 个月公司估值突破 10 亿美元,日活动用户突破两千万。无数年轻人借助这款 AI 倾诉情绪、创作内容、辅助学习,开启全民 AI 陪伴新时代。

创业期间,沙泽尔依旧坚守纯粹的技术初心,不做资本运作、不屑流量营销,将全部精力投入底层模型优化。投资人曾坦言,访谈过程中他全程不谈估值、不谈上市规划,唯一关注的是用户对话体验是否流畅、AI 能否真正为普通人带来价值。

他多次在公开播客中阐述核心理想:“顶尖的人工智能不该被锁在大企业实验室中,每个普通人都有权免费体验、使用 AI 的力量。对话是人类最基础的沟通与娱乐方式,这是 AI 最温暖、最核心的价值落点。”

5.2 创业阶段的生活与工作细节

创业团队初期仅有二十余人,办公场地简陋,沙泽尔和普通工程师共用工位,没有独立办公室。每天最早到公司、最晚离开,亲自查看普通用户的聊天反馈,根据普通人的使用要点、痛点调整模型参数。

他拒绝过度商业化,平台长期保留免费使用通道,不强制付费,即便广告、付费能快速提升营收,也坚持优先保障普通用户的体验。

业余时间,他收集大量用户故事:孤独的年轻人和 AI 倾诉心事、学生借助 AI 写故事、创作者和虚拟角色头脑风暴,这些反馈让他更加坚定 AI 对话的发展方向。

5.3 谷歌 27 亿美元重金回购,诚意召回核心人才

2023 年底,ChatGPT 发布引爆全球,而谷歌在生成式 AI 赛道上陷入被动,管理层意识到放走沙泽尔是巨大损失。2024 年,谷歌抛出总价 27 亿美元的复杂授权收购方案,收购 Character.AI 技术,同时邀请沙泽尔带领核心团队重返谷歌,担任新一代多模态 AI Gemini 的联合负责人。

外界普遍评价:这笔交易本质是谷歌花 27 亿美元买回沙泽尔本人,而整套 Gemini 的底层架构,全部依托他多年前研发的稀疏专家网络、分布式训练、Transformer 优化技术。

第六章 重返谷歌又再度出走:追求不受束缚的技术自由(2024-2026)

6.1 执掌 Gemini,搭建多模态统一 AI 框架

重回谷歌 DeepMind 后,沙泽尔担任工程副总裁、Gemini 联席负责人,统筹文本、图片、音频、视频一体化的 AI 底层架构。他把多年积累的全套技术融合进 Gemini:稀疏专家模块、多头注意力轻量化、多设备分布式训练、长上下文记忆机制,大幅提升多模态模型运行效率。

但回归两年后,他和谷歌企业体系的矛盾再次显现。

第一重矛盾:言论自由。沙泽尔拥有独立、直白的个人观点,曾在公司内部论坛发表关于性别认知的个人看法,引发同事争议,帖子被平台删除、账号发言权限受限。直属领导杰夫・迪恩私下与他沟通,希望他减少容易引发分歧的公开表达,这件事让他感受到大企业内部的言论约束。

第二重矛盾:产品上线节奏。谷歌依旧保持审批保守性,新 AI 功能需要经过法务、安全、市场多层审核,迭代速度远远达不到沙泽尔希望的“快速面向真实用户”的迭代理念。他始终坚持:模型只有交给海量普通人使用,才能快速发现缺陷、持续优化,封闭在实验室反复测试只会拖慢技术发展。

6.2 2026 年加入 OpenAI,十年邀约终落地

2026 年 6 月,沙泽尔在社交平台简单发文,宣布离开谷歌,加入 OpenAI 担任架构研究负责人。OpenAI 创始人萨姆・奥特曼公开表示,自己期待和沙泽尔合作整整等待了十年。

两人理念高度契合:快速迭代、优先面向大众开放 AI 技术、包容研究员自由探讨技术、鼓励大胆创新思路,解除大企业层层繁琐的审批枷锁。

外界解读,这次跳槽不只是简单的人事变动,代表 Transformer 架构的核心奠基人,将主导下一代通用人工智能底层框架的研发,行业新一轮技术变革即将开启。

第七章 世俗生活

抛开技术大牛的身份,沙泽尔的私人生活、待人方式充满反差感,很多细节来自多年同事、播客采访、家人表述。

7.1 家庭观念:温和包容,重视精神陪伴

成年后组建自己的家庭,日常工作再忙碌,也会留出固定时间陪伴家人。受犹太家庭成长环境影响,尊重家人的独立想法,不用自己的思维强迫身边人。

他极少在公开场合谈论家人,刻意保护私生活不被媒体打扰,在社交平台仅发布技术内容,没有任何家人照片、生活分享。

闲暇时,会和家人一起玩玩逻辑桌游、填字游戏,延续童年和父亲相处的模式,把数字推理当作家庭休闲方式。

7.2 性格:纯粹直白,不懂人情世故,内心柔软

1. 不擅长职场圆滑:从不参与办公室派系、职级竞争,不会刻意讨好管理层,有不同意见直接当众说出,不懂委婉迂回,也因此多次和企业管理层产生分歧。同事评价:“他心里只有技术对错,完全不懂职场潜规则。”

2. 待人平等,不分职级:无论是行业顶尖科学家、刚入职实习生、公司保洁、前台,他都同等礼貌对待,交流时专注倾听,不会因为身份差距轻视任何人。当年 Transformer 项目里的本科生实习生,创业多年后,依旧和他保持紧密联系。

3. 共情普通人,理想主义者:他研发对话 AI 的核心动机不是商业盈利,而是希望给孤独、有创作需求、需要倾诉的普通人提供陪伴工具。大量用户和 AI 的聊天记录,让他进一步感慨技术应当温暖人、服务人。

4. 极度谦逊:即便做出奠定行业的核心技术,也不独占功劳,而是强调团队协作的重要性。谈 Transformer 技术,总是介绍其余七位作者的贡献,从不主动标榜自己。和杰夫・迪恩多年共事,始终尊称对方为导师,认可对方对自己职业生涯的帮助。

7.3 趣味事

1. 走廊偶遇改变 AI 历史:如果 2017 年初他没有偶然路过 Transformer 团队办公室、停下旁听难题,多头注意力、缩放平衡、正弦位置标记三大核心创新可能会推迟数年诞生,现代大模型时代整体延后。

2. 不喜欢复杂专业术语,偏爱通俗解释:做技术分享时,会主动把晦涩数学概念转化为生活例子,照顾零基础听众,反感行业内用专业名词制造门槛。

3. 不追求名利和曝光度:行业顶级论坛、媒体专访多次邀约,多数被他拒绝,极少单独接受长篇人物报道,是典型深耕技术、远离舆论聚光灯的研究者。全网能找到的清晰单人照、工作照数量稀少,尽显一心钻研技术、无心追逐名气的纯粹特质。

4. 坚持手写公式草稿:即便办公设备齐全,推导复杂数学逻辑时,依旧习惯纸质草稿纸,办公室常年堆满演算废纸,电脑仅用于代码编写。

5. 不看重物质财富:谷歌、创业公司给他带来了巨额收入,他依旧保持简约生活,不购置奢侈品,资金更多投入新技术研发、支持青年科研者。

6. 喜欢古董级文字游戏:业余爱好是填字游戏、逻辑推理小说,和大学时期课堂项目形成呼应。

7. 对行业固化思维有 “叛逆感”:每当全行业统一认定某条技术路线是唯一标准答案,他总会主动尝试推翻重构,Transformer、稀疏专家网络都是打破行业共识的产物。

7.4 争议与多元观点

沙泽尔直白的个人观点偶尔也引发争议,最典型的是谷歌内部论坛关于性别认知的发言。客观来看,这仅属于他个人世界观表达,和技术研发工作完全分割;他在专业领域始终保持客观、理性、包容的态度,从未将个人主观观点带入技术设计、团队管理中。

业内多数研究者认为,他敢于公开表达独立想法,恰恰体现不迎合集体主流、坚持独立思辨的特质,而这份特质,也是他能不断突破技术瓶颈的核心原因。

第八章 横跨二十六年的技术贡献

很多读者看不懂复杂代码、数学公式,这里用通俗语言,梳理沙泽尔一生三大层级的长远贡献。这里的每一项,都深刻影响我们普通人的日常生活。

8.1 互联网筑基时代:搭建搜索引擎、广告的底层骨架

我们如今使用百度、谷歌、各类浏览器搜索时的错别字提示、网页精准广告匹配,底层算法源头都来自他 2000-2011 年的研发成果,此举奠定互联网早期商业化、搜索体验的基础。

8.2 人工智能底层基石:创造现代 AI 的通用 “骨架”

2017 年推出的 Transformer 全套稳定化的数学设计,是如今所有 AI 产品的统一基础:

1. 聊天 AI:ChatGPT、Gemini、国内各类对话大模型;

2. 图文生成:绘画 AI、短视频文案生成工具;

3. 办公软件:AI 总结、翻译、写作助手;

4. 行业科研:蛋白质结构分析、医疗文本处理、机器翻译。

如果缺少沙泽尔提供的方案,这套框架无法稳定训练,轰动全球的生成式 AI 浪潮至少得推迟数年到来。除此之外,这套架构还支撑了数项足以载入人类科技史册的重磅成果,横跨基础科学、高端工业领域、文化产业,彻底拓宽了人工智能的应用边界。

基础科学领域,依托成熟稳定的 Transformer 架构研发的 AlphaFold2 模型,成功攻克困扰全球化学家五十余年的蛋白质折叠难题,精准实现氨基酸序列到蛋白质三维结构的预测,彻底革新结构生物学、新药研发、生物材料研究范式,这一颠覆性成果拿下2024 年诺贝尔化学奖。需要明确的是,诺奖表彰的是破解生命化学核心难题的科学突破,而沙泽尔完善的 Transformer 架构,是这套顶尖科研模型能够稳定运行、实现精准预测的核心底层底座,是该诺奖成果落地的关键技术支撑。

高端工业与民用科技领域,如今全球所有主流高阶智能汽车自动驾驶系统,核心机制均全面基于 Transformer 架构迭代升级。传统自动驾驶依靠老旧卷积算法,只能局部识别路况,无法关联远距离车辆、行人、路况信息,难以预判复杂路况风险。而沙泽尔设计优化的全局注意力机制,让自动驾驶 AI 拥有了全局视野,能够同时融合摄像头、雷达等多源传感数据,精准识别遮挡物体、预判人车动态行为、规划安全行驶路径。目前特斯拉 FSD、华为全场景智驾、国内新势力全套新一代自动驾驶方案,统一采用“BEV +Transformer”的行业标准架构,所有民用智能汽车的自动避障、自动超车、领航辅助、端到端智能驾驶功能,底层核心逻辑均源自他完善的 Transformer 技术体系,是现代智能驾驶的技术根基。

数字文创与影视工业领域,当下席卷全球的文本生成影视全自动成片技术,同样依托沙泽尔定型优化的 Transformer 底层架构,并由它迭代而来,是当代文化内容产业的技术底座。早期 AI 视频只能生成几秒钟碎片化画面,人物变形、画面闪烁、剧情断裂,无法理解文字剧本、镜头逻辑与场景连贯性,根本做不出完整影视作品。而经过改良的 Transformer 全局注意力机制,完美解决了视频创作的核心痛点:它能读懂完整文字剧本、理解剧情逻辑与场景氛围,记忆上百帧画面细节,全程锁定人物样貌、服饰,场景不变形、不穿帮,自动完成镜头衔接、转场节奏、时空逻辑匹配。如今 OpenAI Sora、字节可灵、Runway Gen4、谷歌 Veo3 等所有顶级电影级 AI 视频工具,以及全网小说转视频、AI 微电影自动成片、智能影视剪辑等工业化功能,全部采用“扩散+Transformer”融合架构,Transformer 负责全局剧情与时空连贯性,扩散模型负责画质细节渲染,彻底实现“一段话生成完整影片”的行业愿景,重塑了影视创作、短视频生产、数字内容制作的全产业链格局。

8.3 推动 AI 大众化:让普通人拥有专属智能对话

他是最早坚持把对话 AI 开放给普通用户的顶尖研究者,创办的 Character.AI 证明:AI 不只是企业、科研机构的工具,普通人可以用它陪伴、创作、倾诉、学习,开辟消费级 AI 全新赛道。如今各大厂商推出的 AI 虚拟角色、陪伴聊天功能,都借鉴他当年的产品思路。

除此之外,分布式训练系统、轻量化优化工具大幅降低 AI 研发门槛,让全球无数中小团队、高校实验室也有条件训练自有大模型,打破头部企业的技术垄断。

第九章 业内同行、后辈、高管对他的评价

9.1 谷歌传奇工程师杰夫・迪恩(多年导师)

“沙泽尔拥有罕见的双重天赋:极致严谨的数学推导能力,同时具备落地大规模工程的实操水平。多数数学家不懂工程落地,多数工程师缺少坚实数学基础与直觉,他二者兼备。他做事永远优先思考技术能给普通人带来什么,这份纯粹在科技行业十分难得。”

9.2 Transformer 项目队友

雅各布・乌斯考雷特在《连线》专访与英伟达 GTC 圆桌论坛中回忆:“当年整个团队卡在训练结果崩溃状态足足半年,所有人只能反复调参试错,只有沙泽尔从数学根源定位梯度爆炸、数值失稳的核心问题,三天给出缩放点积注意力完整解决方案。他是整个项目能落地的关键,没有他,那篇论文只会停留在无法运行的理论猜想。”

论文第一作者阿希什・瓦斯瓦尼补充评价,”沙泽尔为人格外低调,从不争抢功劳,无论媒体采访还是行业分享,他都会主动对外提及八人团队每一位成员的独特贡献。“

9.3 OpenAI 创始人萨姆・奥特曼

“十年以来,我一直希望能和沙泽尔合作。他是少数真正看透通用人工智能底层逻辑的研究者,他的技术理念、开放思维,和我们长期发展方向完全契合。能够邀请他加入团队,是我们的巨大荣幸。”

9.4 Character.AI 早期投资人

“绝大多数技术创业者优先考虑盈利、上市,沙泽尔创办公司的初心只是让普通人用上 AI 对话。他不懂资本套路,全部精力投入模型优化,却意外打造出千万用户级的产品,这是‘技术本身就是最好竞争力’的直接证明。”

9.5 青年 AI 研究者、高校学生

“上课学习 Transformer 架构,教材里所有稳定化核心设计都出自沙泽尔。和其他只会堆砌参数的研究者不同,他每一项创新都有完整数学推导支撑,足以教会我们:AI 技术不能只靠试错,底层逻辑才是根本。而他,对待后辈又十分耐心,愿意无偿分享研发思路。”

第十章 终章:一个理想主义数学天才的时代启示

从费城的犹太小男孩,到国际奥数满分金牌、杜克大学数学竞赛传奇、谷歌初代员工、Transformer 核心创造者、独角兽企业创始人、辗转两大 AI 巨头的架构负责人,沙泽尔的成长与事业轨迹,给数字时代留下清晰的启示。

第一,底层数学思维是突破技术瓶颈的终极武器。整个行业陷入顺序循环 AI 架构的固有思维时,所有人都在小修小补,只有沙泽尔依靠数十年打磨的线性代数、概率、组合数学功底,从根源推翻旧体系,搭建全新技术框架。当年依靠”暴力“调参试错,而他先推导原理、再落地工程。这套思维模式是他持续产出颠覆性成果的指路标。

第二,纯粹的理想主义,才能催生改变世界的创新。他一生不追逐头衔、财富、行业名气,所有选择都围绕一条核心信念:技术应当开放给普通人,服务大众。因为企业保守封闭理念,他放弃高薪高管职位外出创业;因为追求自由创新环境,他不惜两次离开行业巨头。世俗眼中 “不懂变通、过于偏执” 的性格,恰恰支撑他顶住行业主流压力,坚持全新研发路线。

第三,真正划时代的技术,永远来自跨学科融合。他没有局限于纯数学闭门研究,也不只是单纯编写代码,早年打通文字统计、概率数学、分布式三大领域,才能在人工智能爆发期一次性解决多重底层难题。单一领域的深耕只能带来小幅优化,多学科融合才能诞生颠覆性变革。

第四,天才从不独行,谦逊与协作放大创新价值。Transformer 架构是八人团队共同协作的成果,沙泽尔虽提供最关键数学支撑,却始终平等看待每一位合作者,主动均分贡献、随机排序署名。无论身处大厂还是创业公司,他愿意倾听实习生、年轻工程师的新思路,从不凭借资历否定他人想法,包容协作的心态让他持续吸收新鲜思路。

时至今日,沙泽尔依旧站在人工智能底层研发的最前沿。Transformer 架构已经沿用近十年,行业普遍认为现有框架即将抵达性能天花板,而拥有全套底层技术积累、擅长推翻固有范式的他,正投身下一代通用 AI 基础架构的研发。

未来我们使用的新一代人工智能工具,底层依旧会印刻他数十年沉淀的数学思考:从少年时期和父亲玩数字谜题,到奥数赛场的逻辑推演,再到谷歌办公室里一张又一张手写公式草稿,一名数学炼金师,用纯粹的理性与温柔的理想,塑造人类数字文明的走向。

总结:沙泽尔主要贡献

年份 贡献 性质
2000 Google 搜索拼写纠正器改进 工程产品
2000 PHIL 广告匹配算法 商业系统
2000 Google 计算器功能 工程产品
2017 年初 稀疏门控 MoE 架构 学术论文
2017 年中 Transformer 三大核心创新 划时代突破
2018 Mesh-TensorFlow 框架 系统工程
2020 Meena 聊天机器人 研究原型
2021 Character.AI 创始人 创业
2024 Google Gemini 联合负责人 工程管理
2026 加盟 OpenAI 行业转折

纵观沙泽尔的职业生涯,对现代人工智能最具奠基性的三大核心贡献,分别是Transformer 底层数学体系稀疏门控 MoE 架构,以及Mesh-TensorFlow 框架。

其中 Transformer 体系中,由他完善定型的缩放点积注意力、多头分层注意力、三角函数位置编码三大核心创新,构成了所有现代 AI “思维大脑”机制,让机器能真正读懂语言、画面、视频、生命数据、路况等;而另外两项贡献,则让超大模型能方便地“扩展”躯体,AI 可以突破算力限制,从百亿、千亿参数一路升级至万亿级超大规模,在极低算力成本下实现超强智能表现。而这,正是 AI 从实验室走向全民普及的关键支点。

期待与展望

研究诺贝尔奖项评选逻辑,能清晰看见一条恒定主线:诺贝尔在遗嘱中,明确确定设立的奖项,用以表彰为人类带来最大福祉的科学突破。

百多年来大量诺奖成果遵循这一评判标尺:青霉素、胰岛素、青蒿素拯救亿万病患;X 光、CT、MRI 革新医疗诊断;合成氨、锂电池重塑人类生存与发展基础。这些获奖成果大多仅改变单一行业,属于领域级突破,而诺姆·沙泽尔所在的 Transformer 八人团队所完成的创造,是覆盖全学科、全产业的划时代级的最基础底层革命,结合其他人工智能技术,一起成为碳基生命向碳-硅基生命转折标志。

从诺奖近年颁奖趋势看,评奖委员会早已接纳人工智能基础理论价值:2023 年诺贝尔物理学奖颁给霍普菲尔德、辛顿,表彰神经网络基础框架;2024 年诺贝尔化学奖表彰 AlphaFold2 破解蛋白质折叠难题,而这套改写结构生物学、大幅加速新药研发的工具,核心模块正是建立在沙泽尔完善稳定的 Transformer 架构之上。后续生命科学、自动驾驶、文生影视、通用大模型等所有变革,更是由此迭代而出。

对照历届诺奖获奖先例,Transformer 完全契合这一评奖标准。如今这套架构一边支撑抗癌、抗寄生虫新药研发,减轻全球病患痛苦;一边落地高阶智能驾驶降低道路伤亡;同时重构影视文创、语言交互产业,全方位改善人类生产、医疗、生活方式,其作用完美匹配遗嘱中“造福全人类”的核心要求。

可以预判:以诺姆·沙泽尔、阿希什·瓦斯瓦尼、雅各布·乌斯考雷特为核心的 Transformer 八人团队,在未来数年内极大概率斩获诺贝尔物理学奖。

朋友们,让我们翘首以待,静候这一划时代成就,站上最高荣誉领奖台!

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容