智谱开始发起一场关于数字世界解释权的战争 文章

36kr 资讯2026-06-11NEWSzh作者: 锦缎

详细信息

来源站点
36kr 资讯
作者
锦缎
文章类型
NEWS
语言
zh
发布日期
2026-06-11

摘要

2026年,已经是生成式AI诞生以后突飞猛进的第三个年头了。 三年之间,AI行业经历了一场从大语言模型训练,到多模态理解,再到视频生成范式转移的剧烈震荡。 资本与舆论的目光始终聚焦于视频生成的市场、画面与连贯性,一个被长期忽视的深水区痛点如今终于被推到了台前:生成容易,控制难;视觉惊艳,但无法交付生产。 这也是为什么,编程能力和多模态能力都是智能体商业化落地必备的条件,然而后者却总是被忽略,而前者总是被强调。 令人意想不到的是,率先开始系统性解决这个难题的,不是视频生成领域的霸主字节,也不是视频图像模型一应俱全的阿里,而是此前被评价为缺少多模态能力的智谱。 这一次,由智谱创始人和首席科学家唐杰教授领衔,智谱AI与清华大学的研究团队联手发布了一款名为SCAIL-2的模型,用一把精准的手术刀切开了人工智能与工业化影视制作之间的壁垒。 一款低调发布的模型,却意味着一次对数字内容生产底层逻辑的范式挑战:它试图挑战统治行业已久的“中间表示”法则,用一套极简的“端到端”架构,预示了一个意图驱动数字创作时代的到来。 01 从“骨架依赖”到“视觉直觉” 在AI视频生成领域,过去的控制技术长期陷入了一种“符号学崇拜”。无论是Runway还是早期的一些扩散模型,为了让AI实现受控运动,工程界不得不建立起一套复杂的翻译系统: 利用姿态估计器(Pose Estimators),将视频中的人体抽象为骨架图,再把这些骨架图作为约束条件输入模型。 这种“火柴人”的做法,本质上还是让AI学习如何“模仿符号”,而非“理解运动”。在理想状态下,通过数以亿计的“火柴人”进行强化学习听起来很完美,但一旦进入复杂场景,结果就截然不同。多个人物主体的相互遮挡、手部的精细动作,甚至是与非人类角色交互,在这些情景下,“火柴人”构成的系统只会因为深度歧义而瞬间崩溃。 SCAIL-2的革命性正在于此,它宣告了依赖“火柴人”时代的终结。SCAIL-2的核心架构彻底抛弃了显式的中间表示,直接驱动视频的隐空间特征(Latent)和参考角色的隐空间特征进行像素级的拼接,也就是让AI模型直接读取视觉上下文。 这种设计思路,直接让模型从翻译者进化成了观察者。