2026年9月5日
超过 10 秒的 AI 视频:各模型的真实时长,以及便宜一半的做法
每个视频模型到底能到多长,为什么 30 秒的生成是 5 秒的六倍价钱,以及如何用短镜头串起一分钟的片子,剪辑还不花钱。

Frank HoubreImaginode 創辦人
所有人在第一条视频上都会撞到的上限
大多数视频模型停在 5 到 10 秒,少数能到 15 秒,只有三个能在一次生成里做到 30 秒。
你刚生成了第一个镜头。挺好看,运动也对,光也在。然后它只有五秒。你去找那个能拉到一分钟的滑块,它并不存在。
这是所有走进 AI 视频的人第一次失望,而且这失望很合理:人家卖你片子,交付给你的是镜头。只是限制并不是大家以为的那个,解法也一点都不技术。它有一百年历史,叫剪辑。
我们一起来看,把目录里每个模型的准确时长、以积分计的真实价格摆出来,尤其是那个扎心的对比:一分钟视频一次生成要多少,和同样一分钟切成镜头要多少。差距会让你意外。
真实时长,逐个模型
Wan 3.0、Wan 3.0 Prime 和 Seedance 2.5 能到 30 秒,Flux 3 Video 到 20 秒,Kling V3、Seedance 2.0、Wan 2.7 和 Grok Imagine 到 15 秒,而 Veo 3.1 封顶在 8 秒。
这是目录的现状,因为这些上限在别处都没有可读的写法。先说最长的:Wan 3.0 和 Wan 3.0 Prime 接受 2 到 30 秒,Seedance 2.5 是 4 到 30 秒。能摸到半分钟的只有这三个。
紧挨着下面,Flux 3 Video 是 5 到 20 秒。然后是 15 秒这一档:Kling V3 3 到 15,Seedance 2.0 和 Seedance 2.0 Fast 4 到 15,Wan 2.7 2 到 15,Grok Imagine Video 1 到 15。
还有短的,而它们往往是最好的:Kling 2.5 Turbo 给 5 秒或 10 秒,中间没有别的值。Veo 3.1 Lite 和 Veo 3.1 Fast 让你在 4、6、8 秒里选,多一秒都没有。完整目录在模型页上,价格会随你的设置实时变动。
模型为什么这么早就停
算力成本随时长上升,而一致性下降:超过几秒,模型就会跟丢自己那场戏。
两个原因,一个经济的,一个技术的。经济的很简单:生成视频就是每秒产出二十四张必须彼此扣得住的图。算力涨得很快,而供应商按秒计费,因为那正是他们的成本。
技术的那个更有意思。视频模型只能在一个有限的窗口里维持一致性。过了一定时间,脸会慢慢变形,衣服换颜色,桌上放着的东西消失。你多半见过某条二十秒的 AI 视频,里面有什么东西在缓慢漂移,却说不上来是什么。
要明白 5 秒或 10 秒的上限不是商业上的小气。那往往正是模型真正擅长的区间。再往外,你付更多钱,换来一个扣得更松的结果,这是两头都占坏的。
长生成的价格:那个坏消息
计费与秒数成正比:三十秒正好是五秒的六倍,完全没有量的折扣。
这就是大家事后才发现的那一点,也是这篇文章真正要说的。大多数模型上,费率按时长等比计算。没有阶梯价,没有套餐,没有批发价。
准确数字,在 Wan 3.0 上。720p 的五秒是 60 积分。1080p 的十秒是 240 积分。而 1080p 的三十秒是 720 积分,半分钟大约 7 欧元。换成 720p,同样这半分钟降到 360 积分,480p 是 180。
在 Seedance 2.5 上,720p 的三十秒同样是 720 积分,十秒则是 240。Flux 3 Video 的 1080p 20 秒要 696 积分。Kling V3 的 1080p 十秒是 303 积分。按这个价,三十秒的镜头失败一次,你就把七欧元扔出了窗外。
一锤定音的对比:三十秒,两种做法
Kling 2.5 Turbo 上六个五秒镜头是 156 积分,而 720p 三十秒一次生成是 360 积分:不到一半,而且更耐看。
拿一条三十秒的片子,两种算法都算一遍。做法一,一次生成:Wan 3.0,三十秒,720p,360 积分。一次点击,一次等待,一个三十秒的长镜头。
做法二,在 720p 的 Kling 2.5 Turbo 上做六个五秒镜头,每个 26 积分。合计 156 积分。换成五秒 48 积分的 Seedance 2.0 Fast,涨到 288 积分,仍然更低。而把这些拼起来的剪辑不花钱,一会儿就说。
但价格甚至都不是主要论据。有六个镜头,你搞砸一个,就只重跑那一个,26 积分。一次生成,你搞砸第二十二秒,就要把三十秒重付一遍。真正干活时起作用的是这个不对称,而不是一开始省下的那点。
电影已经这么干了一百年
近年电影里一个镜头的平均长度不过几秒:没人会盯着一个固定镜头看三十秒,AI 只是逼你尊重这套语法。
去看任何一条广告、任何一支预告、任何一支 MV。数镜头。三十秒的广告里,常常能数出十来个。长镜头是存在的,很漂亮,也很少见,被留给特定的时刻。
一条让人记住的视频,不是一张持续很久的漂亮图,而是一种在推进的情绪。而情绪靠切来推进:先给脸,再给他看的东西,再给发抖的手。三个三秒的镜头,比同一个画面上固定九秒能讲的多得多。
所以没错,模型的限制一开始是被动接受的。但它把你推到的,恰好就是你本该去的地方。今天做出最好 AI 视频的那些人,不去追三十秒的镜头,他们串起五秒的镜头。
剪辑节点,以及它完全不花钱这件事
剪辑把片段拼起来、裁剪、加上硬切或叠化以及一条声音轨,导出在你的设备上计算,不消耗一个积分。
这就是让整篇文章的做法成立的那个节点。你把视频节点接到它的片段端口上,或者直接从项目媒体里挑,就得到一条时间线。每段片段都能设起点和终点来裁剪。两段之间,你选硬切、叠化,还是转黑。
它也接受静帧,时长可调,这样就能在两个动态镜头之间塞一张标题卡或者一张产品图。而且它带独立的音频轨,每条轨有自己的偏移和音量:你的旁白在一边,音乐在另一边。
重点是:导出免费。计算在你的浏览器里、在你自己的机器上完成,不会扣任何积分。所以你可以把片子重剪十五遍,试三种镜头顺序,换一个转场,一分钱不花。只要在导出期间保持标签页开着就行。
完整流程,从工作计划到导出
先切成镜头,用几个积分的静帧确认每个镜头,只在确认过的图上生成视频,然后再拼。
第一步,在纸上或者一个文本节点里:把你的三十秒切成镜头。六个五秒,或者八个三到五秒。写下每个镜头拍什么。这就叫分场,花十分钟。
第二步,也是最省钱的一步:在为视频付钱之前,用静帧确认每个镜头。一张 Flux 2 Klein 的图是 3 积分,一个视频镜头是 26 到 96。你在这里定取景、调光线、确认人物,全部按图像的价钱。这套方法我在开拍前的 AI 分镜里写详细了。
第三步:每张确认过的图成为一个视频节点的起始图。模型动画的是你已经批准的东西,而不是自己去编一个画面。第四步:全部送进剪辑。到这一步,创作上的关键工作已经做完了。
保持镜头之间的连贯
一个用于人物的参考节点,加一个接到所有镜头上的风格节点,就足以让这六段片段属于同一部片子。
按镜头剪辑真正的风险,是它看起来不像一部片子,而像六条不同的视频粘在一起。人物换了脸,光跳了,颗粒感也不一样。画布在这里就不只是好看,而是有用了。
参考节点稳住人物:给它三张照片和一个名字,然后在你六条提示词里用 @提及 调用它。这个题目在AI 里保持人物一致里有详细处理,如果有人出现在不止一个镜头里,这就是最重要的那块砖。
接到六个节点上的风格节点稳住美术方向:所有地方同一套配色、同一种材质、同一种光线处理。再加一个共享的相机节点,保持镜头焦段和光圈的一致。六个镜头三个节点,接一次线就行。
结束帧:把两个镜头接得看不出切口
有几个模型除了起始图还接受一张结束图:下一个镜头因此可以正好从上一个停下的地方开始。
有个办法,专门用在你真的要连贯而不是要切的时候。有些模型除了起始图还能处理结束图:你给它起点和终点,它来造中间那段路。
在目录里,Seedance 2.0 和 Seedance 2.0 Fast、Seedance 2.5、Kling V3、Wan 3.0 和 Wan 3.0 Prime、MiniMax H3 以及 Veo 3.1 Fast 接受结束图。所选模型支持时,这个接口会自己出现在节点上,不用去找什么隐藏设置。
由此得出的技巧:拿镜头一的最后一帧,把它当作镜头二的起始图。你就得到两段无缝衔接的五秒片段,价钱是两个短片段的价钱。二十秒站得住的运动,就是这么造出来的。
声音:一条轨,不是六条
在每个镜头上都生成音频,会得到六种在剪辑里互相打架的环境声:不如让镜头静音,再在整体上铺一条声音轨。
经典陷阱,而且贵两次。很多模型提供音频开关,而且常常默认开着,因为一条没声音的视频一眼就被发现。对单独一个镜头来说,这挺好。
对准备剪在一起的六个镜头来说,这是个坏主意。每次生成都自造一套环境声,剪起来你会听到六个不同的房间被生硬地切来切去。而且音频要付钱:在 Veo 3.1 Lite 上,720p 的八秒无声 29 积分,有声 48 积分。六次就是 114 积分的差价,换来一个不能用的结果。
静音生成,然后在完整的剪辑上铺声音。一段旁白、一段音乐、几个放在恰当位置的音效,都放在剪辑节点的音频轨上,配好偏移和音量。片子会获得一种整体感,那是各自配音的镜头永远得不到的。
什么时候长生成依然值得
长镜头在无法切开的连续运动、一个推轨或一个渐进的变形上仍有价值,那时就得接受它的价钱。
我不会告诉你长生成从来没用,那不诚实。有些情况它是唯一的答案。在一个场景里连续推轨,一次必须不间断看见的变形,一段舞,一个一切就毁掉效果的镜头。
这些情况下,用 Wan 3.0 或 Seedance 2.5,接受这个价。但要心里有数:先用图确认取景,试验期间把分辨率降下来,只在你确定好的那一版上才升到 1080p。Wan 3.0 上 480p 的三十秒是 180 积分,1080p 是 720,而要确认一个运动,480p 绰绰有余。
顺带一说,这也是目录其余部分的逻辑:用地板价探索,用高价定稿。这套算术的细节在一张 AI 图或一条 AI 视频到底多少钱里,而公开的计算器让你在花掉一个积分之前先模拟自己的片子。
要记住的
用短镜头做的三十秒,成本不到一次生成的一半,可以逐镜头修,而且剪辑免费。
真实上限:Wan 3.0、Wan 3.0 Prime 和 Seedance 2.5 是 30 秒,Flux 3 Video 是 20,Kling V3、Seedance 2.0、Wan 2.7 和 Grok 是 15,Veo 3.1 是 8。没有哪个模型会一口气给你一分钟,而这挺好。
行得通的做法:切开、用图确认、生成五秒的镜头、用参考节点和风格节点稳住一致性、需要连贯时用结束帧衔接,然后一次性剪辑和配音。既然剪辑免费,唯一的成本就是镜头。
第一次动手的话,如果你从没生成过,先看你的第一条 AI 视频,然后回来用六个镜头做一条三十秒的片子。在 Kling 2.5 Turbo 上大约 156 积分,含剪辑差不多一欧元五。
餘額