一、DeepMind权力更迭:从科研圣地到商业引擎
1.1 哈萨比斯的"退"与"进"
杰米斯·哈萨比斯(Demis Hassabis)卸任Google DeepMind首席执行官的消息,标志着这家被誉为"AI界贝尔实验室"的机构正式告别创始人时代。2010年,哈萨比斯在伦敦国王十字车站附近的一栋小楼里创立DeepMind,彼时的愿景简单却宏大:用通用人工智能(AGI)解决世界上最复杂的科学问题。
十五年间,DeepMind从一支不到二十人的研究团队成长为拥有数千名顶级科学家的AI帝国。AlphaGo击败李世石、AlphaFold破解蛋白质折叠难题、Gemini系列模型与OpenAI正面交锋——这些里程碑式的成就,无不烙印着哈萨比斯的个人风格:将深度强化学习、神经科学与计算生物学融为一体,以解决根本性的科学问题为导向。
然而,转任DeepMind董事长兼Alphabet集团首席科学家的决定,折射出AI产业竞争逻辑的深刻变迁。哈萨比斯在内部备忘录中坦言:"当模型参数规模突破万亿级别,当多模态能力成为标配,AI研发的重心已经从实验室里的算法创新,转向工程化落地、算力调度和产品迭代。"这一表态与其说是谦辞,不如说是对产业现实的清醒认知。
董事长角色将使哈萨比斯得以抽离日常运营的繁琐,聚焦于Alphabet层面的AI战略顶层设计。作为集团首席科学家,他将继续主导那些需要长期投入、商业回报不确定的前沿探索项目——量子计算与AI的交叉研究、下一代推理架构、以及更具野心的"世界模型"(World Model)计划。
1.2 卡武克丘奥鲁时代的开启
接替哈萨比斯日常管理职权的是科雷·卡武克丘奥鲁(Koray Kavukcuoglu),这位谷歌首席AI架构师的晋升路径颇具象征意义。与哈萨比斯的学术出身不同,卡武克丘奥鲁是典型的"谷歌体系内成长"的技术官僚。他于2015年加入DeepMind,此前在蒙特利尔大学跟随深度学习三巨头之一的约书亚·本吉奥(Yoshua Bengio)从事博士后研究。
在谷歌的十年间,卡武克丘奥鲁的核心贡献集中在神经架构搜索(NAS)和高效Transformer变体的设计上。他主导的EfficientNet系列模型,以其在计算效率与准确率之间的精妙平衡,至今仍是移动端AI部署的事实标准。升任高级副总裁后,卡武克丘奥鲁面临的挑战远比技术本身更为复杂:
# 简化的神经架构搜索核心逻辑示意
class NeuralArchitectureSearch:
def __init__(self, search_space, efficiency_constraint):
self.search_space = search_space # 定义可搜索的架构空间
self.constraint = efficiency_constraint # FLOPs或延迟约束
def search(self, dataset, target_metric='accuracy'):
# 基于强化学习或进化算法的架构搜索
# 在约束条件下寻找帕累托最优解
best_architecture = None
for candidate in self.search_space.sample():
score = self.evaluate(candidate, dataset)
efficiency = self.measure_efficiency(candidate)
if efficiency <= self.constraint and score > best_score:
best_architecture = candidate
return best_architecture首先是如何整合DeepMind与Google Brain合并后遗留的组织文化冲突。两个团队在研究范式上的差异由来已久:DeepMind偏好强化学习和长期研究项目,Google Brain则更侧重大规模语言模型和快速产品化。卡武克丘奥鲁需要在保持研究自由度的同时,加速Gemini系列模型对OpenAI GPT系列和Anthropic Claude系列的追赶。
其次是算力资源的战略分配。Alphabet在2025财年的资本支出中,超过60%投向了AI基础设施建设,但面对微软与OpenAI的联盟、亚马逊对Anthropic的重金投入,谷歌需要更精准地将有限的高端GPU/TPU资源分配到最具商业回报的产品线上。
1.3 杰夫·迪恩的出走与"Discovery Loop"
如果说哈萨比斯的角色转换尚在预期之内,那么效力谷歌长达27年的首席科学家杰夫·迪恩(Jeff Dean)的离职,则无异于一场"地震"。作为MapReduce、TensorFlow、Spanner等谷歌基础设施的缔造者,迪恩的名字几乎等同于谷歌工程文化的图腾。
迪恩将联合三位谷歌技术骨干创办新公司Discovery Loop的消息,引发了业界对"谷歌人才流失"的广泛讨论。Discovery Loop的命名本身便透露了其技术野心:在现有大模型主要基于"预测下一个token"的范式之外,探索全新的推理和发现机制。
据接近创始团队的人士透露,Discovery Loop的核心技术方向可能聚焦于:
迪恩的出走对Alphabet的短期冲击已经体现在资本市场上——消息公布后Alphabet股价跌逾5%,市值蒸发超过千亿美元。但更深层次的影响在于,这一事件可能开启谷歌"黄金一代"技术领袖的离职潮。当公司规模膨胀到数十万员工,当技术决策日益受到合规、公关和股东回报的多重约束,那些习惯于"20%时间做酷东西"的工程师文化守护者,或许正在寻找更能承载纯粹技术理想的栖息地。
二、国产大模型"双雄并起":GLM-5.3与Wan3.0的技术突围
2.1 GLM-5.3:泄露风波背后的技术野心
在大洋彼岸的谷歌经历人事动荡之际,中国AI赛道迎来了新一轮产品密集发布期。其中最引人注目的,当属智谱AI下一代旗舰模型GLM-5.3的"意外曝光"。
8月初,GitHub及智谱官网上短暂出现了GLM-5.3的技术文档和预览接口,虽然相关内容在数小时内被紧急下架,但已经足够让技术社区掀起分析狂潮。从泄露的文档片段来看,GLM-5.3并非简单的参数规模扩容,而是一次架构层面的重大跃迁。
GLM架构的演进脉络
智谱AI的GLM(General Language Model)系列自诞生之初便走出了一条与GPT不同的技术路线。GLM-1.0采用自回归填空(Autoregressive Blank Infilling)的统一预训练框架,将自然语言理解和生成任务统一为单一的序列生成问题。这一设计使得GLM在同等参数量下,往往在中文理解和推理任务上表现出比GPT架构更优的样本效率。
GLM-4系列引入了基于混合专家模型(Mixture of Experts, MoE)的稀疏激活机制,在保持推理成本可控的前提下将有效参数量推升至万亿级别。而GLM-5.3的泄露信息显示,这一代模型可能在以下维度实现了突破:
# MoE架构的核心机制示意
class MixtureOfExpertsLayer(nn.Module):
def __init__(self, num_experts, d_model, top_k=2):
super().__init__()
self.num_experts = num_experts
self.top_k = top_k
# 每个专家是一个独立的前馈网络
self.experts = nn.ModuleList([
nn.Linear(d_model, d_model) for _ in range(num_experts)
])
# 门控网络决定激活哪些专家
self.gate = nn.Linear(d_model, num_experts)
def forward(self, x):
# 计算每个token分配给各专家的权重
gate_logits = self.gate(x) # [batch, seq, num_experts]
weights, indices = torch.topk(F.softmax(gate_logits, dim=-1), self.top_k)
output = torch.zeros_like(x)
for i in range(self.top_k):
expert_idx = indices[..., i]
expert_weight = weights[..., i:i+1]
# 仅激活top-k专家,大幅降低推理计算量
for e in range(self.num_experts):
mask = (expert_idx == e).unsqueeze(-1)
if mask.any():
output += mask * self.experts[e](x) * expert_weight
return output与华为云的深度协同
GLM-5.3最令业界意外的信息,是其将由华为云驱动的部署方案。这一合作并非简单的算力采购,而是涉及底层软硬件协同优化的深度绑定。华为昇腾910C芯片及其配套的CANN计算架构,为GLM-5.3的推理加速提供了区别于英伟达CUDA生态的替代路径。
从技术层面分析,华为云驱动意味着GLM-5.3可能采用了以下优化策略:
智谱港股在消息刺激下一度涨超9%,反映出资本市场对国产大模型"技术+算力"双自主路径的高度认可。在中美科技博弈持续深化的背景下,GLM-5.3与华为云的结合,不仅是商业层面的联姻,更象征着中国AI产业在关键基础设施层面谋求战略自主的重要一步。
2.2 Wan3.0:文档驱动的视频生成新范式
如果说GLM-5.3代表了国产大模型在语言智能领域的攀登,那么阿里云于8月6日开启公测的Wan3.0视频生成模型,则标志着多模态AI特别是视频生成赛道的重大跨越。
Wan3.0的核心突破在于首次实现了对doc、xls、ppt、pdf、md等文档格式的原生输入支持,文件上限达到100MB。这一特性绝非简单的"多格式兼容",而是对视频生成模型输入范式的根本性重塑。
从文本/图像到文档:输入维度的升维
现有的主流视频生成模型,如OpenAI的Sora、快手的可灵、以及Runway的Gen系列,其输入端主要依赖文本提示词(Text Prompt)和参考图像。这种模式的局限在于:文本的语义密度有限,难以精确传达复杂的时间线、数据关系和逻辑结构;而单张静态图像则无法承载叙事性的信息组织。
Wan3.0的文档输入能力,本质上是在视频生成流程中嵌入了一个"文档理解-知识提取-视觉转化"的完整管线:
## 输入处理流程示意
1. 文档解析层
- PDF:提取文本、表格、图表及版面布局信息
- PPT:解析幻灯片结构、动画逻辑、演讲者备注
- Excel:识别数据序列、公式依赖、可视化配置
- Markdown:保留层级结构、代码块、数学公式
2. 语义理解层
- 构建文档级别的知识图谱
- 识别关键实体、时间线、因果关系
- 提取情感倾向和叙事节奏
3. 视觉转化层
- 将结构化知识映射为镜头语言
- 生成关键帧布局和时间轴规划
- 协调多模态元素的时空一致性
4. 视频生成层
- 基于扩散Transformer(DiT)架构生成连续帧
- 强化人像细节刻画与情绪表达
- 输出30秒高质量视频人像细节与情绪表达的技术实现
Wan3.0特别强调对人像细节的刻画与情绪表达能力,这直指当前视频生成模型的最大痛点。现有模型在生成人物面部时,往往出现五官漂移、表情僵硬、眼神空洞等问题,尤其是在长序列生成中,面部一致性难以保持。
阿里云技术团队可能采用了以下创新方案来解决这一挑战:
API定价策略的行业意义
Wan3.0的API定价设定在0.3至1.5元区间,这一价格带具有明确的战略意图。对比国际同类产品——Runway的Gen-3 Alpha标准套餐月费35美元(约合250元人民币)且生成时长受限,Pika Labs的按需计费模式每段视频约0.5-2美元——Wan3.0的定价策略显然瞄准了大规模商业化落地。
0.3元的起步价对应的是基础分辨率和标准生成速度,主要面向个人创作者和中小团队;1.5元档位则提供高清输出、快速通道和更多自定义参数,服务于专业视频制作机构。这种阶梯定价既降低了试用门槛,又为阿里云留下了充足的单位经济模型优化空间。
三、技术纵深:大模型竞赛的底层逻辑变迁
3.1 从规模竞赛到效率竞赛
2023年至2025年,全球大模型的竞争主线无疑是"规模"——参数越多越好,训练数据越庞大越好,GPU集群规模越夸张越好。GPT-4、Gemini Ultra、Claude 3 Opus,无一不是这一逻辑的产物。
但进入2026年,风向正在转变。GLM-5.3的MoE架构、Wan3.0的文档原生理解、以及Discovery Loop可能探索的分布式认知,共同指向一个新的竞争维度:效率与专用化。这里的效率不仅指推理速度和计算成本,更包括模型从输入到输出的信息转换效率——如何用更精简的参数、更少的计算步骤、更直接的输入方式,达成更强大的任务表现。
DeepSeek-V3的经验已经证明,通过精细的工程优化和架构创新,数百亿参数的模型可以在特定任务上匹敌万亿参数的巨头。这种"以小博大"的技术路线,对于算力资源相对受限的中国AI企业而言,尤其具有现实指导意义。
3.2 多模态融合:从"拼接"到"原生"
Wan3.0对文档格式的原生支持,揭示了一个重要的技术趋势:多模态AI正在从"多模态拼接"走向"多模态原生"。
早期的多模态模型(如GPT-4V)本质上是在文本大模型的基础上,通过适配层(Adapter)或投影层(Projection Layer)将图像、音频等模态的信息"翻译"成文本token可以理解的嵌入表示。这种架构的瓶颈在于,不同模态的信息在融合过程中会经历语义损失,尤其是结构化文档中包含的版面信息、层级关系和空间布局,很难被简单编码为一维的token序列。
原生多模态架构的探索方向包括:
3.3 推理能力的范式突破
GLM-5.3泄露信息中提到的"史诗级推理能力提升",指向的可能是测试时计算(Test-Time Compute)Scaling的规模化应用。OpenAI的o1/o3系列已经证明,通过在推理阶段投入更多计算资源进行思维链(Chain-of-Thought)搜索和验证,模型在数学、编程和逻辑推理任务上的表现可以大幅超越单纯扩大参数规模的收益。
智谱可能采用的技术路径包括:
四、开发者生态:从模型能力到应用落地
技术突破的最终价值,取决于开发者能否便捷地将其转化为解决实际问题的应用。GLM-5.3和Wan3.0的发布,正在为国产AI开发者生态注入新的活力。
编程辅助场景的重塑
GLM-5.3在编码能力上的提升,可能体现在对复杂软件工程任务的理解上,而非仅仅是代码补全。现代软件开发已经从"写代码"演变为"理解需求、设计架构、协调依赖、管理变更"的系统工程。下一代编程助手需要能够:
视频内容生产的民主化
Wan3.0的文档驱动生成能力,对知识传播和内容营销领域具有颠覆性意义。想象以下工作流:
这种工作流将专业视频制作的时间成本从数天压缩至数小时,使得高信息密度的知识内容能够以视频形式大规模生产。
五、全球竞争格局:分化与重组
5.1 谷歌的"中年危机"
DeepMind的人事地震和核心科学家离职创业,折射出科技巨头在AI时代的深层困境。当一家公司的AI研发同时面临以下压力时,组织内部的张力便会达到临界点:
Discovery Loop的成立,某种程度上是这种张力的外部释放。如果迪恩和他的团队能够在创业环境中验证全新的AI架构范式,谷歌或许将面临"培养竞争对手"的尴尬;但如果这些探索在大型组织的框架内根本无法发生,谷歌的渐进式创新又可能被更激进的挑战者超越。
5.2 中国模型的差异化路径
与硅谷巨头追求"通用人工智能"的宏大叙事不同,中国大模型厂商正在走出一条更务实、更贴近产业应用的差异化道路。
智谱与华为云的合作,体现了"垂直整合"策略——从底层芯片、中间件框架到上层模型应用,构建可控的技术栈。这种策略在全球化扩张中可能面临兼容性和生态壁垒的挑战,但在服务中国本土政企客户、满足数据主权和供应链安全需求方面,具有不可替代的优势。
阿里云Wan3.0的文档驱动视频生成,则体现了"场景深耕"策略——不追求模型在所有任务上都达到SOTA(State of the Art),而是在特定的企业级场景(如营销内容生产、教育培训、知识管理)中提供端到端的解决方案。
六、结语:在动荡中寻找确定性
2026年8月的这一轮AI产业震荡,无论是DeepMind的权力交接、GLM-5.3的技术突破,还是Wan3.0的场景创新,都在传递同一个信号:人工智能产业正在从"实验室奇迹"阶段迈入"产业重构"阶段。
在这个阶段,单纯的技术参数领先已不足以确保竞争优势。组织的战略定力、人才的凝聚力、生态的开放度、以及对产业痛点的精准把握,将共同决定下一个五年的行业格局。
对于开发者和企业用户而言,这是一个充满机遇的窗口期。当模型能力以月为单位迭代升级,当API成本持续下探,当多模态交互日趋自然,将AI能力嵌入业务流程的门槛从未如此之低。真正稀缺的不再是技术本身,而是对业务场景的深刻理解、对模型能力的创造性运用、以及在快速变化中保持战略耐心的定力。
DeepMind的换帅、GLM-5.3的蓄势、Wan3.0的公测——这三条交汇的时间线,既是对过去的总结,更是对未来的预告。AI产业的故事,远未到达高潮。
💬 评论区 (0)
暂无评论,快来抢沙发吧!