公司动态

阿里 Wan 3.0 今天上线,FLUX 3 两周前刚发:AI 视频的“工程化“拐点到了

📅 2026/8/25 0:21:11
阿里 Wan 3.0 今天上线,FLUX 3 两周前刚发:AI 视频的“工程化“拐点到了
今天下午刷到一条消息阿里 Wan 3.0 正式上线了。单次 30 秒原生视频还支持直接传 PPT、Word、PDF 进去生成视频——你没看错扔一个 PPT 进去它给你吐出一段视频。我第一反应是这玩意跟 Seedance 2.5 有什么区别后来又看到 FLUX 3 上个月也发了MiniMax H3 开源了。一周之内四五个模型扎堆出来。这不是巧合。先说说今天上线的 Wan 3.0 到底做了什么。单次 30 秒原生生成这个不是最意外的——Seedance 2.5 已经做到了。真正让我觉得有意思的是它支持文档输入。你丢一个 .docx 或者 .pptx 进去它能理解里面的文字和排版逻辑然后生成对应的视频内容。这个场景太直接了——企业里做汇报、做产品介绍以前要写脚本、找素材、剪辑现在一步到位。当然效果好不好另说我还没拿到实测资格但方向是对的。然后你再往前看两周。8 月 20 号Black Forest Labs 发布了 FLUX 3主打 20 秒原生音视频同步生成。20 秒不算长但关键是原生音视频同步——画面和声音是同一个模型、同一轮推理生成的不是后期拼上去的。这个技术门槛比大部分人想象的高得多。为什么原生同步音频突然成了主旋律如果你在过去一年里用过任何 AI 视频工具大概率遇到过这个问题角色嘴在动声音晚半秒环境音和画面氛围对不上。原因很简单——以前的视频模型是先出画面再用另一个模型配音两套系统各自为政最后硬拼在一起。2026 年 8 月的这批发布有一个明确的共性大家都在往统一多模态生成的方向走。FLUX 3 是第一个把这件事做出来的。它的架构里视频和音频的 latent 空间是共享的——生成视频帧的同时同一套模型也在生成对应的音频信号。这跟以前的先画后贴有本质区别。MiniMax H3 开源的时候也强调了这一点它支持文本、图像、视频、音频四种模态统一输入原生输出带立体声的 2K 视频。阿里 Wan 3.0 没公开太多架构细节但从它支持文档输入这个能力来看它的多模态理解层应该也做了统一处理——不然不可能理解一个 .pptx 里的多页内容和排版逻辑再转成视频叙事。这个趋势背后的驱动力其实很朴素用户不关心你的模型是分两步还是三步他们只关心音画是不是同步、角色是不是漂移、能不能直接拿来用。以前靠后处理勉强能糊弄但到了商业化阶段糊弄不过去了。另一个值得聊的事中国模型为什么霸榜了彭博社 8 月 9 号发了一篇文章说 Artificial Analysis 的文生视频排行榜前十名里九个是中国模型。可灵 AI、Seedance 2.5、MiniMax H3 占了前三。我读到这个数据的时候愣了一下然后去翻了翻榜。确实如此唯一的非中国模型是 Google 的 Veo 3.1排在第四。这个格局是怎么形成的我觉得有三件事起了作用。第一是场景驱动。中国的短视频和直播生态全球最卷对 AI 视频的需求不是能不能生成而是能不能用。快手做可灵不是为了炫技是因为它有几亿用户每天在刷短视频需要更低成本的视频生产工具。需求倒逼技术迭代这个逻辑在 AI 视频领域特别明显。第二是开源策略。MiniMax H3 开源了MAGI-2 也开源了。有开发者直接拿 H3 的权重在本地搭视频生成服务社区反馈一上来bug 修得快文档补得勤。这个循环在闭源模型里不存在。第三是成本控制。Bloomberg 那篇文章也提到了中国模型的 API 价格大概是美国同行的三分之一到五分之一。Seedance 2.5 生成一段 30 秒视频的成本不到 0.5 美元而 Runway 的 Gen-3 要 2 美元以上。价格差到这个程度用户自然会投票。但这里有个问题我一直在想调用量和用户量领先不等于技术领先。中国模型在短视频、直播、电商这些场景里确实用得好但在电影级制作、长叙事、物理世界模拟这些高难度场景上差距还在。Veo 3.1 在物理规律的理解上明显比大多数中国模型强——你让它生成一个杯子从桌上掉下来碎掉它知道碎片的运动轨迹中国模型偶尔还会出现杯子碎了但碎片飘在空中这种物理错误。从能生成到可工程化中间差了多远8 月的这波发布最让我兴奋的不是哪个模型性能更强而是整个行业正在从能生成走向可工程化。什么叫可工程化三个标准第一结果可预期。以前你给同一个 prompt 跑两次出来的视频可能完全不一样——镜头、角色、风格全变。现在的模型在一致性上做了大量工作。Wan 3.0 号称在角色、道具、空间关系上可以稳定保持Seedance 2.5 支持最多 50 个多模态参考素材。意思是你告诉模型主角长这样它就不会在下一帧换张脸。第二流程可集成。Wan 3.0 支持文档输入意味着它可以嵌入到现有的企业工作流里。你不需要学新工具不需要写 prompt 工程把 PPT 丢进去就行。ComfyUI 甚至出了 MCP 接口让 AI agent 可以直接调用本地的 ComfyUI 工作流——这对开发者来说意味着什么意味着你可以把视频生成写进 CI/CD pipeline 里。第三成本可接受。前面说了价格但真正关键的不是单次生成的价格而是生成到你满意的价格。以前生成一段 10 秒的视频你可能要跑 20 次才能挑到满意的实际成本是标价的 20 倍。现在模型质量上来了成功率高了反复重试的成本降了。这才是真正的成本可接受。还差最后一块拼图看完 8 月所有发布我脑子里冒出一个问题AI 视频生成的工程化已经走了九十九步但最后一步——可控性——还没人真正走完。什么是可控性就是你告诉模型第三秒到第五秒之间镜头从特写拉远到中景背景从白天变成黄昏主角的表情从惊讶变成微笑它真的能做到。现在的模型你给它一个 prompt 描述一个悲伤的早晨它能生成一段不错的视频但你想精确控制每一帧的构图和情绪做不到。这跟语言模型不一样。语言模型你写 prompt 可以精确控制输出因为 token 是离散的。视频的像素空间是连续的控制粒度天然就粗。所以下一步的关键技术突破我觉得不是生成更长的视频30 秒已经够用了也不是生成更清晰的视频1080p 大多数场景够了而是生成你可以精确控制的视频。你觉得这个方向对了还是错了或者说AI 视频生成的下一个分水岭会在哪里欢迎在评论区聊聊。