Noam Shazeer:Transformer 作者、出走者与 27 亿美元的回归
Noam Shazeer 是生成式 AI 时代一条隐秘技术链上的关键人物:他在 Google 早年做过拼写校正与广告系统,参与 Mixture-of-Experts、Mesh TensorFlow 等大规模模型基础工作,又是 Transformer 八位作者之一。人们常把他称为“Transformer 之父”,但更准确的说法是:他是八人团队中的核心贡献者之一,而不是唯一发明人。[1] [2]
他的职业路径格外能说明前沿 AI 人才如何重新定价。2021 年他离开 Google 创办 Character.AI;2024 年,Google 以许可加人才回流的结构让他重返 DeepMind;2026 年,他又离开 Google 加入 OpenAI。故事的核心不是“27 亿美元买回一个人”,而是模型技术、产品控制权、人才和监管如何被捆绑进新型交易。
Character.AI 的交易结构,详见站内连载:《不许发布》;Transformer 八位作者的全景去向,详见站内连载:《把钥匙发出去》。本文只写 Shazeer 的个人技术与职业线。
一、Google 的老员工与大模型的早期工程
Shazeer 在 2000 年加入 Google,据 Wired 的回顾,他属于公司最早的一批工程师。[5] 他起初参与拼写校正与 AdSense 相关系统,随后转向深度学习和语言模型。这段经历说明,他并非突然在 ChatGPT 时代出现的明星研究员,而是在 Google 的大规模工程体系中长期工作的人。
2017 年初,Shazeer 作为一作发表 Sparsely-Gated Mixture-of-Experts(MoE)论文,探索让不同“专家”网络按输入被选择性激活,以增加模型容量而不让每次计算成本等比例膨胀。[4] 这一思路后来反复出现在前沿模型中。此后他又参与 Mesh TensorFlow、T5 与对话系统相关工作,持续追问同一个问题:模型怎样在更大规模上被训练和运行。
二、Transformer 的八个人,不是一个人的神话
2017 年,Google 研究者发表《Attention Is All You Need》。论文提出只使用 attention 的 Transformer 架构,去除循环和卷积结构,在机器翻译任务上获得更好的效果和更高并行性。[2] 这篇论文成为大语言模型、视觉生成与多模态系统的重要技术起点。
论文有八位作者:Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Łukasz Kaiser 与 Illia Polosukhin。论文首页脚注的原话是“Equal contribution. Listing order is random.”(贡献相同,署名顺序随机),所以不能把 Shazeer 写成正式“第一作者”——这不是外界推测,是作者自己写在论文里的。同一条脚注还逐人记下了分工,关于他的一句是:提出了 scaled dot-product attention、multi-head attention 和无参数的位置表示,并且是“几乎参与了每一个细节的另一个人”。[1] [2] Wired 对创作过程的回顾则显示,他在项目后期加入,重写并改进实现,推动实验结果跨过关键门槛。[5]
Shazeer 的价值不在于独占一个名字,而在于将理论直觉变成能跑出结果的工程。Transformer 团队把 self-attention、并行训练、残差结构和大量实验迭代结合起来。它之所以改变行业,正因为八个不同背景的人把一个看似激进的想法做成了可训练、可复现的系统。
三、离开 Google,做一个人人可聊天的 AI
2021 年,Shazeer 与 Daniel De Freitas 离开 Google,创办 Character.AI。它试图让用户创建并与不同人格、角色的聊天机器人互动,早于 ChatGPT 的大众化发布。[6] 创业的动机与大模型时代常见的分歧相似:当公司内部对产品发布、风险和节奏有不同判断时,研究者可能选择带着技术经验另起炉灶。
Character.AI 很快获得用户和融资,也让 Shazeer 从基础模型工程师变成消费级 AI 产品的负责人。他不再只要证明模型能工作,还要处理内容安全、用户关系、产品体验和商业化。技术路线与消费互联网的结合,给后来聊天机器人产品提供了另一种样本。
四、2024:不是 Google 收购了 Character.AI
2024 年,Google 与 Character.AI 达成一项非独家技术许可协议,媒体报道的交易规模约为 27 亿美元;同时 Shazeer、De Freitas 及部分团队成员回到 Google DeepMind。[6] 这个数字要按“媒体报道口径”读:双方均未公布正式金额,报道也没有说明其中多少是许可费、多少对应人才,所以本文不做拆分。 这常被写成“Google 收购 Character.AI”,但并不准确。
公司本身并未被 Google 并入或注销,仍保留产品、用户与品牌并独立运营——它的官方博客此后一直在更新产品公告,本身就是公司仍在运作的直接证据。[3] 更准确的描述是“许可加人才回流”或媒体所谓的 reverse acqui-hire:Google 获得技术许可和关键人才,Character.AI 获得资金与继续运营的空间。Google 当时的公开表述是:“我们很高兴 Character.AI 的人才加入了公司,但我们不持有任何股权,他们仍是一家独立公司。”[6] 这一结构因可能绕开传统并购审查而受到评论者与监管机构的审视;不过截至本文写作,公开信息中没有针对这笔交易的正式指控、处罚或调查结论,因此只能写成“受到审视”,不能写成“已被认定有问题”。
Shazeer 回到 Google 后担任 Engineering VP,并成为 Gemini 的共同负责人之一。看似是一次“回归”,实则说明前沿模型竞争已不只是实验室比较,也是在争夺知道如何把模型做大、做快、做成产品的人。
五、2026:第二次离开 Google
2026 年 6 月 17 日,Shazeer 在 X 上宣布离开 Google、加入 OpenAI。9to5Google 报道称,他此前是 Gemini 共同负责人及工程副总裁;公开信息尚未明确其在 OpenAI 的具体新角色。[7] 因此,不能把他的故事停在“2024 年回归 Google”的圆满结局。
这次转身也使 2024 年交易的意义更加复杂。Google 以许可和人才回流把他带回前沿模型团队,不满两年后他又选择离开。对于个人而言,这是重返研究前沿的选择;对于行业而言,它提醒人们:再高的交易金额也不能永久锁定最顶尖研究者的技术兴趣和职业判断。
TA 的下一步与争议
Shazeer 在 OpenAI 的下一步尚未完全公开。他可能继续从事基础模型、架构、推理效率或产品系统,但在正式披露前不应替他指定职位。可以确定的是,他从 Google、Character.AI、Google DeepMind 再到 OpenAI,始终站在语言模型规模化与产品化的交界处。
他的争议集中在两点。一是技术署名:公众喜欢把复杂突破压缩成一个“之父”,但 Transformer 的成功是团队工作;二是人才交易:许可、股权与回流雇佣的组合能让公司规避传统收购的标签,却也可能绕开监管和市场对集中化的审视。Shazeer 的职业史恰好把这两种现代 AI 的矛盾放在同一条线上。
关键时间线
| 时间 | 事件 | 对人物线的意义 |
|---|---|---|
| 2000 | 加入 Google | 进入大规模互联网工程体系。 [5] |
| 2017-01 | 发表 MoE 论文(一作) | 探索大模型的效率与容量。 [4] |
| 2017 | 共同署名 Transformer 论文 | 成为八人团队的核心贡献者之一。 [1] [2] [5] |
| 2021 | 创办 Character.AI | 从研究者转为消费 AI 创业者。 [6] |
| 2024-08 | 以许可加人才回流方式重返 Google | Character.AI 仍独立运营。 [6] |
| 2024-08 至 2026-06 | Gemini 共同负责人 | 回到前沿模型工程。 [7] |
| 2026-06-17 | 宣布加入 OpenAI | 再次离开 Google,最新转折。 [7] |