阅读,与值得关注的内容Readance

刚刚,中国AI占领全球前四!

  新智元报道  


AI视频,已经开始挑战「实时造世界」了!


9月初,Runway公布GWM Worlds 2研究预览,把音视频生成推进到了实时交互。


你让角色往前走,让房间涌进水,让沙尘暴卷过来,模型就接着生成后面的画面与声音。镜头怎么转、场景怎么变,都能继续下指令。



视频里的世界,开始跟着人的操作往下演。


但一个问题也跟着冒了出来:画面接得上,物理就一定说得通吗?


一篇名为PhysWeep的预印本,给「视频模型懂物理」泼了盆冷水。


研究人员测了三个开放视频生成模型。其中两个,在能追踪运动的样本里,暴露出一个问题:动作看着自然,物理参数却没按要求变化。生成结果,反倒更受随机种子左右。


画面演得挺像,物理题却做错了。


这道坎,恰恰卡在视频生成继续往前走的路上。


视频模型似乎学会了「马上回应」,却还没有学会「合理回应」:角色看似实时行动,场景随指令变化,但水为什么这样流、物体为什么这样倒、人物为什么此刻作出反应,仍在考验模型。


实时交互解决的是延迟,理解世界最需要的是逻辑。想让模型模拟事情如何发生,光靠几秒惊艳的画面,显然交不了卷。


就在这个节点,智象(HiDream.ai)发布原生全模态视频模型HiDream-O1-Video-1.0(下文简称HiDream V1)。


这是一款全新的「原生全模态」视频生成模型。它瞄准的,正是物理合理性、叙事规划和音画同步。


说得直白一点,就是让模型更懂创作者想要什么,生成的视频更连贯,也更接近可用素材。


首次参评,就在Artificial Analysis图生视频榜(含音频)杀入全球第四,Arena图生视频盲测榜全球第八。



这一刻,在全球最顶级的多模态视频牌桌上,又挤上来一位狠角色——智象HiDream V1。


此前,MiniMax、字节Seedance、阿里万相,已经在全球AI视频赛道打出了声量。


如今,智象带着双榜前十的成绩,挤上了同一张牌桌。


中国AI视频「四小龙」,凑齐了。



双榜前十
中国视频模型全面占领全球第一梯队


1080P、5—20秒范围内灵活生成、音画一体化,这些是HiDream V1交出的基础配置。


更有意思的,智象给这套能力提出的要求:听懂人想拍什么,让动作按合理的顺序发生,让声音跟着画面里的事件走。


拯救「废片率」:当视频模型真的懂了物理规律


HiDream V1最令行业惊艳的能力,是对物理规律的理解与建模。


物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减——这些物理规律直接被写进了视频模型的叙事之中,成为画面生成的底层逻辑。


对做视频的人来说,这件事只有一个衡量标准:素材可用率。


同一段镜头,过去反复抽卡才能挑出一条能用的,现在第一遍就能用——省下的每次重抽,都是实打实的时间和钱。


来看几组真实的同题对比测试。


场景一,高速赛车从镜头前疾驰而过,引擎声必须表现出逼真的多普勒效应。


A模型生成的画面中,赛车的车尾突然变成了车头。车还在往前跑,朝向却接不上了。


HiDream V1在这组演示中保持了行驶方向,引擎声也随赛车经过镜头,从高音调过渡到低音调。


这个场景要看的是,车的位置、朝向和声音变化,能不能对应同一次运动。车身再漂亮,中途突然掉个头,整段视频也会露馅。


多普勒效应听着专业,它管的是最朴素的一件事:引擎声卡在车经过的那一帧上,不用后期再逐帧对轨。



上:HiDream V1;下:A模型


把场景搬到太空,连喝口水都成了一道物理题。


HiDream V1跑出来的画面,宇航员轻轻一吹,悬浮的水球随之晃动变形,再逐渐恢复圆润、缓缓飘远;她伸出手指拨回来,凑上前一口吸进嘴里。


这段最绝的地方在于,水球怎么变形、往哪边飘,每一步都严丝合缝地对上了人物动作,瞬间就把「太空喝水」那种失重的真实感给立住了。  


已关注
关注
重播 分享 赞
观看更多
    新智元

    0/0

    00:00/00:10
    进度条,百分之0
    00:00
    /
    00:10
    00:10
    全屏

    倍速播放中
    您的浏览器不支持 video 标签

    继续观看

    刚刚,中国AI占领全球前四!

    转载
    ,
    刚刚,中国AI占领全球前四!
    新智元
    已同步到看一看写下你的评论


    再把三种材质放进同一道题:抽走托板,让网球、玻璃弹珠和橡皮泥从同一高度落下。


    HiDream V1生成的效果,网球落桌后明显弹起,玻璃弹珠的起伏小得多,蓝色橡皮泥则落地变形,留在原处。


    同样是落到桌面上,三种材质交出了不同的反应,弹性和软硬的区别,也就有了直观的画面。



    下面这个demo,看着简单,但考的其实也是最基础,也最容易翻车的物理规律——自由落体。


    一大一小两颗铁球从同一高度同时松手,全程并排、同步加速,最后几乎在同一瞬间砸向地面。


    HiDream V1把几个关键的细节,都接住了——


    球没有一前一后乱飘,大小比例也没变,落地时还用一声重响、石板裂纹和扬尘把冲击感做了出来。


    已关注
    关注
    重播 分享 赞
    观看更多
      新智元

      0/0

      00:00/00:10
      进度条,百分之0
      00:00
      /
      00:10
      00:10
      全屏

      倍速播放中
      您的浏览器不支持 video 标签

      继续观看

      刚刚,中国AI占领全球前四!

      转载
      ,
      刚刚,中国AI占领全球前四!
      新智元
      已同步到看一看写下你的评论


      再来看农家小院里的压水井,男孩弯腰用力压下长杆,一股水随之涌进搪瓷盆,压杆抬起后,水流逐渐收细、停下。


      HiDream V1把反复压水的过程接了起来,男孩身体的起伏、压杆的转动和水流的断续,有了对应的节奏。


      已关注
      关注
      重播 分享 赞
      观看更多
        新智元

        0/0

        00:00/00:12
        进度条,百分之0
        00:00
        /
        00:12
        00:12
        全屏

        倍速播放中
        您的浏览器不支持 video 标签

        继续观看

        刚刚,中国AI占领全球前四!

        转载
        ,
        刚刚,中国AI占领全球前四!
        新智元
        已同步到看一看写下你的评论


        还有一个特别能说明问题的案例,一扇几百年历史的古堡老木门,双手极其缓慢地推。


        A模型生成的画面中,物体扭曲变形,B模型则出现了用力方向和开门方向相反的荒诞画面。


        而HiDream V1将缓慢推门的动作与门轴摩擦声对应了起来。


        推门这个动作,藏着好几层约束:手的施力方向要与开门方向对得上,门要围绕门轴转动,摩擦声也得跟着动作走。


        只要其中一环错位,再阴森的古堡、再逼真的木纹,都救不回这一幕。


        顺便说一句创作自由度的变化:过去这种多层物理约束的镜头,基本没人敢写进提示词——写了也大概率翻车,宁可绕开。现在敢写,本身就是能力边界外扩的信号。


        左:HiDream V1;中:A模型;右:B模型


        这几组案例,把视频生成的难点摆到了眼前:单帧画面可以很漂亮,但一旦动起来,物体之间的关系就得连续成立。


        视频里的下一步,得接得住上一步。 


        这一步之差,就是一秒视频和一条能用的镜头之间的差距。


        AI听懂你在说什么了


        当然,生成翻车,有时从第一步就开始了。


        除了动作本身,模型还得先弄明白:用户到底想让什么事发生?


        通常人们给到的提示,往往口语化、碎片化、模糊化。


        比如,拍得紧张一点,就这么一句话,究竟是让人物表情紧张,还是镜头快速推进?


        说「突然安静下来」,是关掉背景音乐,还是连环境声也要收住?


        人和人沟通时,可以靠语境补齐。模型如果只抓关键词,就很容易把所有元素都画进去了,结果整段视频仍然不对味。


        HiDream V1的做法完全不同。它在生成之前前置了多模态意图理解模块,先对视频内容进行结构化规划:


        镜头时长、场景地点、画面内容、首帧约束、在场角色、动作表情、台词节奏、光色影调、景别构图、运镜焦段、背景声与音效设计……


        可以把它理解成,把自然语言,转写为可执行的分镜语言。


        理解越深,规划越稳;规划越稳,后续联合生成越不容易「跑偏」。


        这次,我们连完整句子都没给,只丢过去几个词:「雨、咖啡馆窗、路过的红伞、慢一点、有点想家。」


        HiDream V1生成效果如下,一把红伞从窗外缓缓走过,随后离开镜头,窗边的咖啡还冒着热气,整段留出了安静看雨的时间。


        隔着雨窗看人来人往,那点「想家」的情绪,有了可以落脚的场景。


        已关注
        关注
        重播 分享 赞
        观看更多
          新智元

          0/0

          00:00/00:10
          进度条,百分之0
          00:00
          /
          00:10
          00:10
          全屏

          倍速播放中
          您的浏览器不支持 video 标签

          继续观看

          刚刚,中国AI占领全球前四!

          转载
          ,
          刚刚,中国AI占领全球前四!
          新智元
          已同步到看一看写下你的评论


          接下来,我们还设计了一个自带反转的「拆弹」戏——


          两个人守着倒计时的盒子,为剪红线还是蓝线争得满脸紧张,钳子一合,喷出来的竟是生日彩带。


          没想到,HiDream V1接住了这段剧情的转折,从剪线前的慌张到彩带扑脸后的错愕,把「先让人捏把汗,再让人笑出来」的意图演了出来。


          已关注
          关注
          重播 分享 赞
          观看更多
            新智元

            0/0

            00:00/00:14
            进度条,百分之0
            00:00
            /
            00:14
            00:14
            全屏

            倍速播放中
            您的浏览器不支持 video 标签

            继续观看

            刚刚,中国AI占领全球前四!

            转载
            ,
            刚刚,中国AI占领全球前四!
            新智元
            已同步到看一看写下你的评论


            时长自适应:不让秒表控制你的故事


            另一个容易被忽视的变化,发生在时长上。


            大多数视频生成模型遵循的是,固定提示词路线。


            用户写「生成5秒」,模型就只能在这个时间窗口里填充内容,内容叙事被迫适应时长。


            这听起来理所当然,但仔细想想,这是一个根本性的错位。


            真实世界里,一件事该用多长时间讲完,是由事情本身决定的,不是由你手里的秒表决定的。


            举个栗子,故意要求HiDream V1在3秒内,不紧不慢地把三杯茶依次倒满。


            视频中,AI没有为了硬卡时长突然加速,而是让水流、水位和换杯动作自然接下去,把整件事完整做完。


            该快的地方快,该停的地方停。时长服务的是叙事,而不是叙事迁就时长。



            目前,HiDream V1原生支持5–20秒任意时长生成。


            人们不需要再纠结「我该写几秒」——你只需要告诉模型你想表达什么,剩下的交给模型判断。该三秒就三秒,该十秒就十秒。


            写提示词的体验也跟着变了,过去要在开头结尾反复写「注意重力、保持一致、不要穿模」这类补丁,现在这些是默认项,提示词只需要讲故事。


            时长有了弹性,连续画面里的细节也得守住。


            再看一个看似简单、却很考验细节的动作:原地转一整圈。


            HiDream V1生成的视频中,女生转身露出背后的「07」,再转回正面,胸前的「NEW 2026」依然清晰,短发和黄色小包也保留了下来,最后还笑着歪了下头。


            难点就在这一来一回:暂时离开视野的细节,重新出现时,还得接得上。



            我们又让HiDream V1拍了一段嗦面,小伙把面条一根根吸进嘴里,接着拿起玻璃杯喝水,对镜头竖起大拇指,用四川话说出了「巴适」!


            这段有意思的地方在于,嗦面占了大半段,喝水和最后的表情又各有停顿,一连串动作接下来,有了日常吃饭的节奏。


            已关注
            关注
            重播 分享 赞
            观看更多
              新智元

              0/0

              00:00/00:14
              进度条,百分之0
              00:00
              /
              00:14
              00:14
              全屏

              倍速播放中
              您的浏览器不支持 video 标签

              继续观看

              刚刚,中国AI占领全球前四!

              转载
              ,
              刚刚,中国AI占领全球前四!
              新智元
              已同步到看一看写下你的评论


              音画同步,是共生出来的


              另外,音画不同步,是AI视频生成模型的一个「通病」。


              原因在于,当前多数视频模型采用的是后期拼接路线:先逐帧生成画面,再回头配音配效。


              就像先拍电影,再配字幕,总是差那么点意思。


              HiDream V1则直接啃了块硬骨头,死磕「原生全模态架构」,对文本、视频、音频信号进行联合建模。


              三者在同一生成过程中相互约束、相互对齐:画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。


              毋庸置疑,效果也是立竿见影。


              镜头切换时,环境声与配乐随之过渡;人物开口时,口型、气口与情绪同频;物理动作发生时,拟音效果与撞击反馈更贴近真实因果。


              下面这个demo中,士兵从轻声耳语「我们需要支援」,突然切换为拼尽全力大喊「小心炮袭」。


              D-V1不仅台词清晰准确,情绪的转换和音效的爆发力也与画面严丝合缝。


              已关注
              关注
              重播 分享 赞
              观看更多
                新智元

                0/0

                00:00/00:10
                进度条,百分之0
                00:00
                /
                00:10
                00:10
                全屏

                倍速播放中
                您的浏览器不支持 video 标签

                继续观看

                刚刚,中国AI占领全球前四!

                转载
                ,
                刚刚,中国AI占领全球前四!
                新智元
                已同步到看一看写下你的评论


                再听一列火车呼啸而过:汽笛由尖变沉,随列车远去,考验的正是声音能否跟上运动中的多普勒效应。


                画面里,车厢依次掠过,女孩按住草帽,头发和裙摆被气流扬起,车过后才慢慢落回。


                汽笛的变化、列车的位置和人物的反应,得落在同一次经过里,这一幕才有身临其境的感觉。


                已关注
                关注
                重播 分享 赞
                观看更多
                  新智元

                  0/0

                  00:00/00:12
                  进度条,百分之0
                  00:00
                  /
                  00:12
                  00:12
                  全屏

                  倍速播放中
                  您的浏览器不支持 video 标签

                  继续观看

                  刚刚,中国AI占领全球前四!

                  转载
                  ,
                  刚刚,中国AI占领全球前四!
                  新智元
                  已同步到看一看写下你的评论


                  再来看个同款测试,列车从隧道深处一路驶来,由远及近音调升高、驶过后降低。


                  更细的一点是,车身高速经过时带起的风压,也准确传到了画面边缘被吹动的碎纸上,声音、速度和物体反应是对得上的。


                  已关注
                  关注
                  重播 分享 赞
                  观看更多
                    新智元

                    0/0

                    00:00/00:14
                    进度条,百分之0
                    00:00
                    /
                    00:14
                    00:14
                    全屏

                    倍速播放中
                    您的浏览器不支持 video 标签

                    继续观看

                    刚刚,中国AI占领全球前四!

                    转载
                    ,
                    刚刚,中国AI占领全球前四!
                    新智元
                    已同步到看一看写下你的评论


                    下面这个案例测的,是视频模型最容易暴露短板的地方:中文口型对齐和情绪切换。


                    前半段女主语气平静地说,「我马上到,你先点菜」,后半段听到消息后表情瞬间僵住,情绪起伏非常明显。


                    而且,每个字不仅念的准,还与口型一致。


                    已关注
                    关注
                    重播 分享 赞
                    观看更多
                      新智元

                      0/0

                      00:00/00:12
                      进度条,百分之0
                      00:00
                      /
                      00:12
                      00:12
                      全屏

                      倍速播放中
                      您的浏览器不支持 video 标签

                      继续观看

                      刚刚,中国AI占领全球前四!

                      转载
                      ,
                      刚刚,中国AI占领全球前四!
                      新智元
                      已同步到看一看写下你的评论



                      三篇顶会论文
                      撑起后训练


                      现在,把意图理解、动作、画质和声音放在一起,新的问题来了:


                      这么多目标,怎么同时提高?


                      画面更锐利了,人物却变脸;动作幅度变大了,物体开始变形;声音很丰富,却抢掉了台词。视频质量很容易顾此失彼。


                      智象披露的技术路径是:先规划,再联合生成,随后通过多模态奖励信号进行对齐——后训练采用扩散模型强化学习(Diffusion RL),引入多模态Reward模型,对画面保真、叙事连贯、身份一致、物理合理性和音画同步等维度进行评估。


                      通俗地说,模型练习之后,还需要一套尽量接近人类观感的评分方式,帮助它往更好的结果靠近。


                      撑起这套后训练的,背后有三项顶会论文支撑——


                      DMSampler(ICML 2026)、DiffusionCompass(ECCV 2026)、EvoID(CVPR 2026)。


                      DMSampler:让模型练得起


                      视频模型每练一轮,都需要生成样本、获得反馈,再调整。生成本身就消耗计算,反复练习,成本很快叠上去。


                      DMSampler瞄准的,就是训练阶段的采样开销。


                      它用少步数的蒸馏采样器生成奖励评估所需的样本,并随着模型更新,周期性地重新蒸馏采样器。


                      这样,后训练就有机会以更低的采样成本持续推进。


                      这个改进首先服务于训练效率,不能直接换算成用户生成一条视频快了多少。但它解决了一个基础问题:模型想不断进步,得有成本可承受的练习方式。



                      DiffusionCompass:得分涨了,画面也得真的变好


                      练得起之后,还要防止练偏。


                      强化学习依赖奖励反馈。如果模型过度迎合评分方式,可能出现分数提高、生成多样性下降,甚至钻评分规则空子的情况。


                      DiffusionCompass给训练引入了外部高质量样本作为参照。


                      DiffusionCompass架构


                      模型继续用自身生成的样本探索,同时借助这些质量参照校准优化方向,减少奖励过拟合和「刷分」的风险。


                      这就是「质量锚定」,模型追求更高奖励时,要有可靠的生成质量作为参考。


                      放到创作者的需求里,这件事很好理解。谁都不希望模型只学会讨评分系统喜欢,却把画面越练越单调,或者丢掉原本自然的细节。


                      EvoID:动作再大,也得认得出是同一个人


                      第三项研究,落在视频最容易让人出戏的问题上:身份保持。


                      一个角色正面看是一张脸,转个头却像换了演员。对于要拍连续剧情的人来说,这样的素材再漂亮,也很难接着用。


                      EvoID对应的正是身份保持这一环,为生成过程中维持人物身份一致提供研究支撑。


                      这里要守住的,是角色在动作、视角等变化中的可辨认性。人物可以转身,可以改变表情,观众仍应认得出:这是刚才那个人。


                      低成本采样、质量锚定、身份保持,三篇论文串成一条线:一篇负责省,一篇负责准,一篇负责稳。而省、准、稳,最终都会落到创作者的同一本账上。


                      视频生成的单价在下降,但动作变形、人物变脸和结果偏离预期,依然可能让创作者反复尝试、重新等待。


                      前面的采样效率、物理合理性评估、质量锚定和身份保持,解决的正是这些藏在单价之外的成本:


                      让模型生成得更稳一些,让素材离「可用」更近一些,也让每次尝试少一点无效消耗。



                      一个底座+四类模型
                      闭环形成了


                      但如果只把HiDream V1当成「又一个视频模型」,就低估了它在智象棋盘上的位置。


                      要看懂这一步,得先看智象整盘棋的下法:一个底座,四类模型。


                      底座只有一个,叫UiT——智象自研的统一架构,今年4月以「原生全模态世界模型HiDream-O1」的名字发布。


                      从那之后,四类模型全从这一个底座上长出来:


                      图像模型HiDream-O1-Image,主打「空间理解」。商用版1.5版本在Artificial Analysis文生图榜单中取得中国第一、全球第二。


                      交互式世界模型HiDream-O1-World,名列行业首个交互式世界模型基准WBench综合总榜第一。该模型具备漫游、编辑、交互三大功能,时空一致性和物理一致性实现关键突破。


                      具身世界模型HiDream-O1-Embodied,在RoboColiseum的扰动适应和空间推理子榜单中登顶榜首。


                      随着HiDream V1的发布,业内首个原生全模态世界模型闭环就此成型。


                      图像、视频、3D交互与具身动作,在统一原生的世界模型中交汇、共生、循环。



                      图像负责呈现空间,视频加入时间变化,交互和具身模型进一步涉及动作与反馈。


                      用创始人兼CEO梅涛一句话概括,智象要构建的是「一个原生全模态底座、四大模型同源演进」的矩阵。


                      这四条线不是各自为战,而是一套面向世界模型持续进化、走向落地的体系。


                      从模拟世界,到理解世界


                      AI视频模型的下一个突破点在哪里?


                      分辨率更高、画质更细、时长更自由,当然都重要。


                      但当一段视频真正动起来,观众还会追问:这件事,现实里会这样发生吗?


                      手推门,门得顺着合理的方向开;苹果抛出去,要沿着连贯的轨迹被接住;骨牌倒下,碰撞得一块接一块传过去。


                      这些细节单独看都很小,连起来,却决定了整段视频能不能让人信服。


                      HiDream V1这次值得关注的,也正是这条方向:把物理合理性与意图理解、叙事规划、音画生成放到一起,让模型在追求画质之外,继续处理运动、交互和前后状态。


                      几组demo还不足以证明模型已经全面掌握物理规律,但它们把接下来该比什么,摆得更清楚了。


                      从「看起来像真的」,走向「事情真的会这样发生」,才是视频模型继续抬高能力上限的关键。


                      这也接上了智象布局世界模型的思路:感知当前状态,推演变化过程,再进一步回答行动会带来什么结果。


                      一个UiT底座、四类模型同源演进,视频补上的这一环,最终要经得起连续事件的检验。


                      画面可以惊艳一秒,真实得经得起下一秒。


                      编辑:桃子 摩西


                      秒追ASI
                      ⭐点赞、转发、在看一键三连⭐
                      点亮星标,锁定新智元极速推送!

                      前往微信阅读全文

                      内容来自公众号,可前往微信查看原文。

                      查看作者的更多文章 →