公司动态

当“参数神话“破灭:DeepSeek V4为何同时发两个版本,AI竞争的下一个变量是什么?

📅 2026/7/30 23:48:40
当“参数神话“破灭:DeepSeek V4为何同时发两个版本,AI竞争的下一个变量是什么?
全球首个开源MoE视频模型来了当Wan2.2省一半算力、Aleph把编辑变对话声画一体仍是最后一块拼图7月28日深夜阿里通义万相团队正式开源Wan2.2系列视频生成模型几乎同一时间Runway的上下文视频编辑模型Aleph开始面向付费用户全面开放。一个把生成做到电影级美学一个把编辑做到自然语言对话级。两条路线、两种范式同周发力标志着AI视频生成赛道正在经历一次结构性分化。但仔细看这两个模型的能力边界你会发现一个有趣的共同点它们都在画面层面突飞猛进却在声音与表演的同步层面保持沉默。这不是巧合而是整个行业当前最真实的瓶颈。Wan2.2用MoE架构给视频生成减负通义万相Wan2.2最引人注目的技术突破是业界首次将MoE混合专家架构引入视频生成基础模型。传统视频生成模型在去噪过程中使用统一网络处理所有时间步但扩散模型的高噪声阶段和低噪声阶段关注点完全不同——前者负责构建场景整体布局后者负责打磨细节纹理。Wan2.2的思路很直接既然两个阶段做的事情不一样那就用两个不同的专家分别处理。具体来说27B总参数的模型被拆分为高噪专家和低噪专家每次推理只激活14B参数计算资源消耗直接降低约50%。在视频生成这个Token越长越烧钱的领域这个优化幅度意味着同样算力下可以生成更长、更高质量的视频或者在消费级显卡上跑起来。Wan2.2还开源了一个5B的统一视频生成模型Wan2.2-TI2V-5B采用高压缩率3D VAE架构仅需22G显存就能在数分钟内生成5秒720P视频。换句话说一张消费级显卡就能本地部署——这对独立开发者和小型团队的意义不言而喻。电影级美学控制系统把导演的语言装进模型Wan2.2另一个亮点是电影级美学控制系统。这不是简单的风格滤镜而是把光影、色彩、构图三大电影美学元素编码成了60多个可控参数直接嵌入模型的精调流程。用户输入黄昏柔光边缘光暖色调中心构图等关键词模型能自动理解并生成对应美学的画面换成冷色调硬光对称构图低角度就能切换到科幻片质感。官方展示的案例中Wan2.2甚至能复刻《星际穿越》中宇航员在米勒星球的经典画面。更值得关注的是Wan2.2在人物面部表情和复杂运动维度上有显著提升。官方提到模型不仅能生成大笑惊恐等基础情绪还能刻画思考时不经意的挑眉强忍泪水时的嘴唇颤抖等精细微表情。这些能力的提升说明视频生成模型正在从会动走向会演。但这里有一个微妙的问题Wan2.2生成的微表情是画面里的表情而不是配合声音的表情。换句话说嘴型变化和声音输出之间没有因果关系——它生成了一个看起来在说话的画面但这个画面并没有对应任何具体的语音内容。Runway Aleph从生成到编辑的范式跳转如果说Wan2.2代表的是从无到有的生成路线那Runway Aleph开辟的是一条全新的从有到优的编辑路线。过去18个月AI视频赛道的竞争几乎集中在单一维度如何把文字提示或图片更好地变成全新视频。Runway自己从Gen-1到Gen-4都在这条路上推进。但Aleph做了一件不同的事——它不生成新视频而是编辑已有视频。技术层面的关键在于上下文理解。传统AI视频编辑的工作方式是分析-理解-重新生成这导致未修改的部分也会发生漂移背景细节偏移、纹理变化、空间结构微妙重组。Aleph的做法是先对素材建立三维空间理解——深度关系、光源方向、材质属性、空间几何——然后在这个精确的空间模型上做修改。结果是被修改的部分有完整空间上下文未修改的部分则被真正保留而非重新生成。Aleph能做的事情覆盖了实际制作中的高频需求移除场景中的物体或人物、改变角色外观和年龄、重新打光、改变天气和季节、生成新机位角度、风格迁移、绿幕抠像。其中最改变制作经济性的是机位生成——从单个镜头生成其他角度的画面这在传统流程中需要多机位拍摄或昂贵的VFX重建。Aleph目前面向Runway付费用户开放。它的出现意味着AI视频工具开始覆盖已有素材的后期修改这个比从零生成更常见的真实需求。两条路线同一个盲区Wan2.2和Aleph代表了AI视频生成领域两个截然不同的技术方向一个追求无中生有的生成质量一个追求锦上添花的编辑能力。但如果你把视角拉高会发现它们都聚焦于同一个层面——视觉画面。Wan2.2能把微表情做到嘴唇颤抖的精度但这个嘴唇的颤抖并不对应任何语音波形。Aleph能从单个镜头生成新机位但新机位里的人物并不会说出新台词。两个模型都在看的维度上不断突破却在听和说的维度上留白。这不是技术选型的问题而是架构层面的结构性缺失。当前主流的视频生成模型无论是开源还是闭源大多采用级联式架构先生成画面再单独生成音频最后做唇形对齐。这种先画后配的方式天然存在同步鸿沟——嘴型是基于画面内容生成的声音是基于文本内容生成的两者在生成时互不感知后期对齐只能做到看起来差不多做不到真正一体。在实际应用中这个问题尤其影响人物表演类内容。一个数字人主播说话时嘴型和声音哪怕有几十毫秒的偏差观众就会感到不对劲一句台词的情绪起伏如果没有在面部表情上同步体现整个表演就会显得生硬。这些问题在纯画面生成模型中不存在因为它们不需要处理声音但在真实的视频制作场景中声画同步是基本要求不是加分项。联合生成下一代视频模型的技术拐点正因如此业内已经有一些团队开始沿着联合生成的方向探索——不是先生成画面再配音而是在模型底层让声音和画面同时生成、互相感知。这条路的技术难度显然更高因为它要求模型同时处理音频和视觉两个模态的时序对齐问题但从结果上看这是解决声画一体问题的根本路径。从产业逻辑来看这个方向的探索正在加速。一方面开源模型如Wan2.2把画面生成的门槛大幅拉低5B模型甚至能在消费级显卡上跑这意味着画面本身的差异化空间在缩小。另一方面Runway Aleph证明了编辑这个被忽视的场景有巨大需求。当画面生成和编辑都日趋成熟后下一个竞争维度自然会转向表演级生成——不只是画面好看还要声音、表情、口型三者浑然一体。一些专注于人物表演方向的数字人工具已经在这条路上取得了实质性进展。它们不是在视频生成模型上加一层配音而是从底层建模时就让声学特征和视觉特征联合生成使得每一帧画面的嘴型、表情都与对应的音素精确匹配。这种声画同出的方式在数字人直播、短视频带货、多语言内容制作等需要大量人物表演内容的场景中已经开始展现出效率优势。结语画面已至表演未满Wan2.2的开源和Aleph的发布是AI视频赛道的重要节点。前者用MoE架构把生成效率推向新高度后者用上下文编辑打开了全新的应用场景。它们共同把画面这个维度推向了新的成熟度。但我们也应该看到当画面生成不再是瓶颈当视频编辑可以像对话一样简单行业竞争的焦点必然会向更深层的表演一致性转移。声音与画面的同步生成不是一个附加功能而是下一代视频模型的底层能力。谁先跨过这道坎谁就能在AI演员这个真正有产业价值的市场中占据先机。而这道坎目前还没有人完全迈过去。