2026年进程大半,AI视频有了哪些质的变化?
记得前段时间的WAIC,智象未来(HiDream.ai)发布了内容创作智能体vivago R1,对话式交互、多模态能力、稳定生成3至5分钟完整视频……让人印象深刻。
就在昨天,vivago R1正式全球上线,国内的版本「够搭」 也全新升级发布。
昨天vivago「够搭」沉浸式工作坊的现场,氛围特别热烈,感受到一种AI视频行业经济上行的美。
想结合我自己用够搭做视频的体验,跟大家说说几个很强烈的观感。
01
从15秒到5分钟,时长和质感提升明显
长时序生成、主体一致性、实时编辑,这是曾经视频生成的几大痛点。
vivago R1,把曾经的上限又一次抬高,尤其是视频时长,直接来到3至5分钟。
而且,现在已经支持任意时长视频的连贯生成,能适配短剧、专题片、品牌宣传片等等各种品类视频的创作。
给大家看一个我用vivago R1做的广告片:
眼神的情感表达、光影的变幻、发梢水珠细节的呈现,几乎都达到了商业直接可用的级别。而且是动动嘴直接「说出来」的一条视频。
会觉得当前的AI视频创作,正形成两条路线。
一条是节点式工作流路线。
通过将模型API封装为从剧本到成片的完整工作流,借助多节点编排实现长视频生成。
另一条则是以vivago R1为代表的对话式Agent路线。
vivago R1把复杂的剧本编排、镜头调度、角色一致性、叙事逻辑全部封装,现在作为用户,只要像讲故事一样说出想法,AI就自动完成从脚本到成片的完整交付。
真的方便了很多,让我想起当年ChatGPT重新定义了Chat。
技术上,会觉得vivago R1非常讲究。
智象未来本身就有很强的视频模型背景,这一次,依托自研的HD-AgentOS智能体操作系统,重新搭建了资源层、系统层、能力层三层耦合架构。
通过多智能体集群协作,去模拟专业团队分工,让用户不用再面对画布、节点和复杂工作流,只需要用自然语言描述创作意图。
之前我在剪映工作,经历了从轨道编辑时代,到模版特效,再到画布节点Agent的转变。
但是深入用了vivago R1之后,会觉得,这一次的体验大概更能代表未来。
02
长视频,用Chat稳定交付
长视频生成最大的痛点是跨镜头一致性,具体表现为画面跳变、人设崩塌、叙事断层和风格割裂。
之前总感觉用AI生视频像赌徒一样,花费大量时间抽卡、拼接和修复穿帮。
而vivago R1,创作全链路用语言交互,可控性很好,实测基本上都是一边出,不需要二次抽卡。
给大家看看我这个,一段话直出的有剧情的电影片段:
说出指令之后,vivago R1具备长任务思考能力,可自主完成精细化逻辑构思、镜头排布与风格校准。
先是会生成人物、场景、环境、事物等等,细节很到位。
然后会像影视工作室一样,很系统完整的执行视频制作的过程。
能看出来,底层的模型能力,和Agent的交互设计,都是非常前沿的水准,实际生成的结果非常好。
看到HiDream-O1-Image-1.5,在Artificial Analysis文生图榜单中位居全球第三、中国第一;
HiDream-O1-World在交互式视频世界模型评测基准WBench榜单中,也以平均分80.9登顶榜首,其中物理维度73.3分位列第一、一致性维度达88.0分。
也正是底层模型在物理真实性与一致性上的突破,为vivago R1的长视频稳定交付提供了技术底座。
发布会现场,听产品负责人提出了一个CHATS 标准,特别有意思。
CHATS五个字母,分别代表了一致性、意图理解、视听完成度、时间线与叙事、稳定交付。
按照 Chat-First 的对话式创作方式,实际用的时候,不管是商业级可交付的视频,还是高连续性的爆款影视/短剧内容,都能有很丝滑的呈现。
03
从一次成片到持续生产:AI视频进入生态化阶段
关于AI视频,最近还有一个点我非常关心:创作生态。
接下来,谁会是AI时代的抖音呢?新的创作者会聚集在哪里呢?
今天我们看到的vivago R1,支持角色、风格、场景和创作资产的持续复用,已经可以让第一支视频成为下一集、下一条广告、下一轮社媒内容的起点。
到现在,vivago已覆盖全球120多个国家和地区,拥有6000万注册用户和百万级付费用户。
而这些可能都还只是开始。
从一次成片到持续生产,从单点工具到生态平台,AI视频正在从生成内容走向生成世界,这不仅是技术的演进,也是创作范式与产业格局的深层重构。
还记得当初Sora横空出世,留给人们关于长视频生成的很多想象。
到今天,vivago R1的5分钟视频,也让我想起DeepSeek R1的国民级影响。
AI视频生成,用两年时间,从技术演示到工业化工具,到落地实现。
也许,谁能真正把模型能力转化为创作者可依赖的生产力,谁就能在下一个时代占据牌桌的核心位置。
不妨来试试!
英文官网:vivago.ai
够搭官网: goudaai.com