
发现视频模型又开始大乱斗,而且战斗力一个比一个强,模型的迭代速度也越来越快。
不光是模型本身的能力越来越强,价格也开始下降,但相较于普通的通用大语言模型(LLM),目前视频模型的价格还是高很多,不是普通用户随便烧的。
作为一个不想花费太多成本的我,哪些便宜的视频模型能让普通用户畅快的用起来?
我也正想借用视频模型,以一个导演的视角去生成我一直以来非常想拍摄的几个类型的大制作,来稍微弥补小时候的导演梦。
于是找了两个目前主流且价格还算美丽的视频模型进行对比,看看便宜的视频模型哪个更能打,哪个更适合我圆梦。
首先是前王者 Seedance 2.0系列,由于Seedance 2.5 API 已经在火山官方正式上线,Seedance 2.0 fast 价格自然也引来了折扣,打折下来 720P 的视频可以做到 0.6 元/秒,已经非常有性价比,例如一条 15 秒的视频,跑下来差不多 9 元,也还算合理。

另外一款我选的是MiniMax H3,虽然是比较新的视频模型,但是价格居然也做到了5 毛一秒,和 Seedance 2.0 fast 相差不大,用他们两个同样的跑768P的视频,放在一起对比再合适不过了,这样比较下来就明显能够看到谁更有性价比。

如果作为导演我非常想拍三种类型的片子,一是由于热爱网球运动非常想拍一部类似《F1:狂飙飞车》这样讲述网球运动的电影;二是作为一个近两年沉迷于国漫的影迷,希望能够创作出类似《凡人修仙传》、《仙逆》、《灵笼》等经典国漫的动画;三是作为一个从小就能背电视广告的人,希望能够拍一条非常有记忆点的广告TVC。

所以下面我借助 AI创作的视频是和这三类紧密相关的,一方面我非常熟悉能够客观的给出评价,二是以普通用户角度尝试能否生成大制作高难度视频作品。
我会着重从指令遵循、物理规律、风格特效、人物一致性和商业可用性进行考察, 为了尽可能节省 Token(也是费用)每个模型只抽卡1次。
首先第一个场景希望借助一场网球比赛考察下纯粹的运动视频生成能力,在高速运动下非常考视频模型的验物理规律、人物动作和空间感。
这里让两个模型在同一 Prompt 下分别生成一个男子网球比赛,较早之前我测试这类运动的时候,网球几乎是乱飞,人物的动作各种扭曲变形,现在这个场景测试我还挺期待的。
Seedance 2.0 fast
MiniMax H3
一段15秒、16:9横屏、写实体育直播风格的职业网球比赛。地点是傍晚的室外硬地球场,两名没有现实人物原型的男子网球运动员正在比赛:近端球员穿白色上衣和深蓝色短裤,远端球员穿红色上衣和白色短裤。
镜头从近端球员身后的低机位开始。近端球员将网球向上抛起,完成一次有力的右手发球,球拍必须准确击中网球。远端球员快速向左侧移动,用双手反拍将球回到对角线;近端球员向右跑动,完成一次正手直线回球;远端球员勉强救球,随后近端球员冲到网前,用反手截击结束这一分。
网球在每次击球之间只能沿连续、合理的抛物线运动,必须越过球网,并在规定区域内落地;球不能消失、分裂、突然改变方向,也不能穿过球拍或人体。两名球员的位置、服装和持拍手在整个视频中保持一致。
摄像机以稳定的体育转播方式轻微跟随网球运动,不切换镜头。声音包括准确同步的四次击球声、运动鞋摩擦地面的声音、球员呼吸声和最后观众的短暂欢呼声,不要解说,不要背景音乐。从抽卡一次的真实的效果来看,Seedance 2.0 fast 在头两秒就杀死了这一轮比赛,其人物的发球、击球、奔跑、网球的弹跳与真实的几乎是一致的,物理规律的能力太强了,画面的流畅度、声音的契合程度都做的比较到位,一度我以为自己在欣赏“德约科维奇”的比赛。

Seedance 2.0 fast 视频截图
相比之下MiniMax H3在一开始的发球就出现了明显的问题,这发球动作怕是在业余比赛都会被嫌弃😂,随意乱跳且不止一颗网球出现在球场让人眼花缭乱。在物理规律上也有非常明显的漏洞,两个人在没有球对着空气对打的名场面也让我哭笑不得,另外声音与画面的同步度不够对整个视频也有明显的影响。

第二个场景是我每周在追的国漫,现在《凡人修仙传》、《仙逆》、《灵笼》等国漫的画面精美程度已经非常优秀,特别是特效尤为炸裂,无数刻我都在想如果我是导演这个场景我会如何设计。于是第二次比较我直接以国漫为基础,导入用 AI 生成的人物角色和场景进行参考,主要测试风格、人物一致性与特效融合。
Seedance 2.0 fast
MiniMax H3
参考图1保持青年修士的面部、发型、服装和佩剑完全一致;
参考图2保持黑色山谷、石甲异兽及整体电影级3D国漫风格。
石甲异兽突然跃起挥爪攻击,青年修士侧身闪避,双手快速结印,背后浮现金色环形符文,随后操控三把飞剑从不同方向同时击中异兽。撞击产生碎石、火花和金色冲击波,异兽被击退但没有死亡。
快速流畅的电影运镜,动作连贯且有力量感。青年形象全程一致,异兽结构稳定,三把飞剑数量固定;攻击路径和受击反馈清晰,音效与动作准确同步。15秒,16:9,无对白,无字幕。
输入的参考图
这次对比,我认为两个产品生成的质量都比网球比赛的效果更好,但是两条片子的呈现还是有一定的差异。
Seedance 2.0 fast ,首先在指令遵从和多模态参考上有不错的执行力,另外整个片子人物的脸部和衣服、怪兽的外观等一致性全程在线,在风格和特效表现高于预期,例如镜头切换自动给出了分镜画面、对于碎石的特写是较为震撼的。

Seedance 2.0 fast 视频截图
MiniMax H3在这条视频的质量明显高于网球,不管是人物脸部还是衣服、怪兽的一致性做的很出彩,但是在一些细节上还是有问题,例如特效光环直接穿头、剑刺向怪兽但没有碎石飞起存在一定的问题,整体特效表现上会稍弱于Seedance 2.0 fast。

不管视频模型怎么吹,最终也要落到生产上,其实商业广告TVC就是一个极为典型的场景,现在电梯里面的广告很多都是直接用 AI 工具合成,而这次我要打造一个气泡饮料的广告,通过运镜、水花的溅落与文字的稳定性看看两个模型是否达到商业可用的程度。
Seedance 2.0 fast
MiniMax H3
一段10秒、16:9横屏、专业商业广告风格的视频。产品是一罐虚构品牌的银色气泡水,品牌名称为“TIDE 7”,罐身正面只有清晰的黑色文字“TIDE 7”和一条细小的蓝色波浪图案。
第一镜头是银色易拉罐立在铺有薄冰的黑色石台上,表面带有真实冷凝水珠。镜头缓慢推近,易拉罐保持直立并缓慢旋转约90度,但品牌名称“TIDE 7”始终拼写正确,不能变形、增字或缺字。
第5秒,一片青柠从画面上方落下,准确落入易拉罐旁边的透明玻璃杯,水花向外溅起。第9秒切换到产品英雄镜头:易拉罐回到正面,背景出现蓝色水波和细小气泡。画面下方逐渐出现一句清晰、稳定、拼写正确的英文广告语:“STAY CLEAR”。
产品形状、拉环结构、品牌文字和蓝色波浪图案在所有镜头中保持一致。声音包括易拉罐开启声、青柠落水声、气泡声和简洁轻快的电子音乐。不要出现其他品牌、其他文字、人物或旁白。
输入的参考图
Seedance 2.0 fast 在商业广告的呈现作品稍微有些平,可能是我的提示词给的还不够有创意。也有意外之处,例如整个片子镜头的转换、文字的稳定性、光影的处理都算上佳,另外专门考察的水花溅落物理规律问题也不大,但精细度我认为还差点意思。

Seedance 2.0 fast 视频截图
MiniMax H3也有同样的问题,整体的画面比较平,除开水花溅落的细节处理的不太完美,运镜、文字处理、光影都保持了稳定在线,这次整体画面的精细程度更好一些,基本达到了商业可用素材的表面。

确实视频模型在飞速的发展,肉眼可见的进步,并且在价格持续下降的情况下保持很好的质量和表现,实打实的让普通用户也能在低成本的情况下可以用上好的模型,这点是非常牛的。
这次借机测试的两个性价比较高的模型,在指令的遵循、风格特效、一致性和商业可用上都有很好的表现,但是各自也有自己更厉害的一面。
Seedance 2.0 fast 在物理规律上的测试全程在线,不管是人物的动作、光影的变化、物体的移动都表现的非常强悍,另外在细节的处理上可以给到夯,另外在风格与特效的处理上也非常惊艳,高可用性王者的位置坐的非常牢。
MiniMax H3整体表现也还不错,在画面的精细度上有优势,并且能够做到2K的清晰度非常厉害,但是我认为每个测评的维度上又稍微弱于Seedance 2.0 fast ,特别是在物理规律有比较明显的弱点。
在两个视频模型成本价格差不多的情况下,可能我还是会选择Seedance 2.0 fast ,因为从测评的整体性来讲的都会更高,更直白点就是钱花的更值一些。
也希望 AI 模型在持续快速进步的同时,能有更多的普通用户发挥无限的创意形成越来越多的优秀作品,丰富整个生态形成良性的循环。
如果你要进行AI视频创作,你会使用怎么选?