📅 2026年06月18日 · 星期四 · 奇点AI未来派
Transformer之父跳槽了OpenAI——大模型最底层的地基,可能要换了

Transformer论文共同作者Noam Shazeer离开Google DeepMind加入OpenAI,大模型架构进入后Transformer时代 | 来源:奇点AI未来派AI生成
你每天用的ChatGPT、Claude、Gemini,它们最底层的地基,是同一个东西。
那个东西叫Transformer。2017年,八个人写了这篇论文,彻底改写了AI的历史。而今天,其中最重要的一位——Noam Shazeer——离开了Google DeepMind,加入了OpenAI。
这不是一个普通的人才流动。Shazeer是Gemini模型的联合负责人,是Character.AI的创始人,是谷歌花了27亿美元买回来的人。现在OpenAI把他挖走了,专门让他做一件事:探索后Transformer架构。
这意味着什么?意味着那个统治了AI界八年的地基,可能要开始松动了。而今天除了Shazeer这条线,AI Agent基础设施也迎来三连爆发,科创板为AI大模型开了上市绿灯,硬件赛道则上演了一场冰火两重天的戏码——五条线同时拉开,今天的信息密度极高。
01 | Transformer之父今天跳槽了OpenAI——大模型的地基,开始松动
这件事的分量,可能比你想象的大得多。
Noam Shazeer——Transformer论文的第三作者,Character.AI的创始人,Google DeepMind的工程副总裁兼Gemini联合负责人——今天正式宣布离开DeepMind,加入OpenAI,出任架构研究负责人。
这已经是Shazeer第二次离开谷歌了。2021年他离职创办Character.AI,2024年谷歌以约27亿美元的交易把他买回来,让他主导Gemini的预训练。两年后,他又走了——这一次,目的地是OpenAI。

Shazeer在OpenAI探索后Transformer架构:从注意力机制到下一代模型框架 | 来源:奇点AI未来派AI生成
🔍 Shazeer的三次转身
• 2017——Transformer论文发表,Shazeer作为核心作者之一奠定AI基础设施
• 2021——离开谷歌创办Character.AI,估值达50亿美元
• 2024——谷歌27亿美元收购Character.AI,Shazeer回归主导Gemini预训练
• 2026——再度离开,加入OpenAI任架构研究负责人,专攻后Transformer方向
OpenAI让他负责的具体方向是"探索新一代AI模型架构"。翻译成大白话就是——OpenAI认为Transformer架构已经接近天花板,他们需要有人来寻找下一个突破点。而这个人,恰好就是设计当前架构的核心作者之一。
我有一种直觉:Shazeer跳槽不是为了更高的薪水,而是为了一个更自由的实验场。在谷歌,他要维护Gemini的稳定性;在OpenAI,他可以放手去试那些可能在Gemini团队里"太激进"的想法。OpenAI正在筹备IPO,他们需要的不只是GPT-5.6——他们需要一个能让人相信"下一代架构就在这里"的叙事。Shazeer就是那个叙事的核心。
02 | 今天的AI Agent基础设施,一口气爆了三个
如果说Shazeer的故事讲的是"底层架构",那今天的第二条线讲的是"上层应用"。
AI Agent的基础设施,今天一口气炸了三个重磅:
AI Agent基础设施三连发:Vercel Eve开源框架+Databricks Omnigent多智能体+Google ARD开放规范 | 来源:奇点AI未来派AI生成
🤖 三大Agent基础设施同日发布
• Vercel开源Eve框架——文件系统优先设计,每个Agent对应一个磁盘目录。内置持久执行、沙箱计算、人机审批、多通道支持六大生产级能力,Apache-2.0许可
• Databricks发布Omnigent——Matei Zaharia(Spark创始人)打造的多智能体元框架,可在单会话中运行Claude Code、Codex、Cursor、Pi等多Agent协同
• Google发布ARD开放规范——用于在Web上发布、发现和验证AI工具、技能与Agent。支持加密验证确认发布者身份后再连接,让Agent可以像网站一样被"搜索引擎"发现
这三件事串在一起,我看到一个非常清晰的趋势:AI Agent正在从"实验室玩具"变成"互联网基础设施"。
Vercel的Eve解决的是"怎么把Agent跑在生产环境"——持久执行、沙箱、人机审批,这些都是生产级必需品。Omnigent解决的是"怎么让多个Agent协作"——Claude写代码、Codex做测试、Cursor做补全,同一条链上并行推进。Google的ARD解决的是"怎么让Agent被发现"——就像DNS让网站可以被找到一样,ARD让Agent可以被搜索引擎级别的发现机制找到。
2024年我们说"大模型元年",2025年我们说"AI应用元年"。到了2026年,Agent的底座已经基本搭好了。接下来就不是"能不能做Agent"的问题了,而是"谁做得更快、谁做得更稳"的问题。
03 | 科创板给AI大模型开了绿灯——还没赚钱的公司,也能上市了
如果说前两条讲的是技术和应用,这一条讲的是钱。
今天,上海证券交易所发布《第10号指引》,将科创板第五套上市标准扩展至AI大模型企业。这意味着——尚未形成一定收入规模的优质AI大模型企业,也可以在科创板上市了。

科创板第五套标准扩至AI大模型企业:AI人工智能ETF平安涨2.24%,市场反应积极 | 来源:奇点AI未来派AI生成
📈 市场第一时间反应
• 中证人工智能产业指数早盘涨+1.46%
• 中际旭创涨+4.29%,光迅科技涨+4.13%
• AI人工智能ETF平安(512930)涨+2.24%,冲击5连涨
• MiniMax、智谱等已在港股上市的大模型公司,此前已启动A股回归计划
我为什么觉得这件事重要?因为第五套标准原来是给生物医药企业用的——那些研发投入巨大、产品还没上市、但技术路径清晰的公司。现在AI大模型企业也可以走这条路了。
想想看:一家大模型公司,算力采购每年几十亿,模型训练周期长达数月,短期内几乎没有营收——按传统标准,它根本不可能上市。但现在,只要它的技术路径、研发团队、专利积累足够扎实,就有机会通过第五套标准登录资本市场。
这对AI创业公司来说,是一个从"活下去"到"站着活"的分水岭。以前只能靠融资续命,现在可以直接面对资本市场。当然,这也意味着更大的透明度和监管压力——上市从来不只是礼物,也是承诺。
04 | 一个99美元,一个2195美元——今天的AI硬件,冰火两重天
技术、基础设施、资本都说完了,最后我们来看看AI怎么走进你的客厅。
今天有两款AI硬件产品上市,但它们的命运截然相反。
Google发布了首款Gemini智能音箱,售价99.99美元。它彻底抛弃了传统Google Assistant的指令式交互,全面接入Gemini生成式AI——你可以自然语言多步指令、中途纠正、连续对话。高级功能订阅10美元/月。
Snap则发布了历经12年研发的AR眼镜Specs,售价2195美元。CEO斯皮格尔说它要"将计算技术引入现实世界"。但市场直接用股价投票——Snap股价大幅下跌,投资者认为2195美元的定价在当前市场毫无普及可能。

AI硬件冰火两重天:Google 99美元Gemini音箱vs Snap 2195美元AR眼镜股价暴跌 | 来源:奇点AI未来派AI生成
🔍 两组数据对比
• Google Gemini音箱:99美元——直接对标Echo Dot,用生成式AI重新定义智能音箱交互
• Snap AR眼镜:2195美元——比一部iPhone还贵4倍,市场直接用股价暴跌回应
• 同日Meta宣布与依视路陆逊梯卡合作,将推出Prada和Oakley品牌AI眼镜——走的是时尚品牌联名路线
这两件事放在一起看,我得出一个判断:AI硬件的胜负不在技术参数,而在定价哲学。99美元的音箱是"我帮你升级生活"的逻辑——便宜、好用、不需要学习。2195美元的AR眼镜是"我重新定义生活"的逻辑——昂贵、前卫、但需要你先相信这个未来。
市场显然更相信前者。而Meta和依视路陆逊梯卡的Prada+Oakley路线,恰恰是第三条路——不是让硬件更便宜,也不是让硬件更酷,而是让硬件变成你本来就戴的东西。这三条路谁会赢?至少今天的市场告诉你:先别把价格定得太高。
05 | Grok 4.3创最低幻觉率,MiniMax M1开源100万上下文——大模型性价比之争白热化
今天还有两件关于大模型本身的事,值得你关注。
xAI的Grok 4.3今天正式上线Amazon Bedrock。它的核心卖点有两个:第一,在多项基准测试中排名第一的同时,达成了最低幻觉率——也就是说它比其他前沿模型更不容易胡说八道。第二,支持100万token上下文。定价也很狠:输入1.25美元/百万token,输出2.50美元/百万token——每美元智能度是其他前沿模型的2到10倍。
MiniMax则开源了首个推理模型M1。它同样支持100万token上下文输入,而且在部分任务中算力使用不到DeepSeek-R1的一半——同时保持不限量免费使用,API定价为业内最低。这是MiniMax持续五天更新发布计划的一部分。

Grok 4.3最低幻觉率+MiniMax M1开源推理模型100万上下文:大模型性价比之争白热化 | 来源:奇点AI未来派AI生成
📊 大模型性价比对比(今日更新)
• Grok 4.3——Bedrock最低幻觉率,100万上下文,输入$1.25/M token
• MiniMax M1——开源推理模型,100万上下文,算力消耗不到DeepSeek-R1一半,不限量免费
• MiniMax M3——已接入支付宝Token Pay,3亿笔AI支付完成商业化验证
• 趋势——大模型竞争从"参数规模"转向"性价比+场景落地",降价和开源成标配
我一直在追踪大模型的价格走势。从2024年的动辄上百美元每百万token,到今天Grok 4.3的1.25美元——大模型正在经历一场比智能手机还猛的价格战。而且这场价格战的核心指标不再是"谁参数最大",而是"谁幻觉率最低"、"谁上下文最长"、"谁性价比最优"。
MiniMax M1开源则意味着另一件事:推理能力不再是闭源模型的护城河。当开源模型也能做到100万上下文、算力消耗减半、不限量免费——那些还在靠"推理能力独占"撑起高价订阅的闭源模型,得重新想想自己的护城河在哪里了。
我今天的感受
今天五条线串起来,我看到一个很清楚的画面。
架构在松动——Transformer之父跳槽OpenAI,专攻后Transformer方向。统治AI八年的地基,第一次有了被替换的可能。
基建在搭桥——Eve、Omnigent、ARD三连发。Agent不再是实验品,它正在变成互联网级别的基础设施。
资本在开路——科创板第五套标准扩至AI大模型。还没赚钱的公司也能上市了——这是对AI创业者最硬的一张底牌。
终端在博弈——99美元的音箱赢了市场,2195美元的眼镜输了股价。AI硬件的第一场仗,不是技术仗,是定价仗。
今天最让我震撼的不是某个具体的数字,而是Shazeer这个人。他造了Transformer,然后两次离开自己亲手搭建的系统,每次都是为了寻找下一个可能性。在所有人还在优化Transformer的时候,他已经去思考"Transformer之后是什么"了。
这让我想起一句话:真正改变世界的人,不是守着旧地基的人,而是第一个问"地基能不能换"的人。
💬 今日互动
Transformer之父Shazeer跳槽OpenAI专攻后Transformer架构——你觉得Transformer还能统治AI多久?五年?十年?还是说下一个突破点已经有人在暗处偷偷打磨了?欢迎在留言区告诉我你的判断。
本文由【奇点AI未来派】整理
内容来源于公开技术资讯,每日准时更新
主要来源:CSDN AI科技热点日报、AIToolly、财联社、TechCrunch、Hacker News等