
字节Seed 团队发布了新一代视频创作模型——Seedance 2.5。

这是要让导演和演员失业的节奏嘛..先别急着下结论。
单次生成 30 秒、支持多轮延长、多模态参考全面升级、精准编辑能力……每一项都戳在视频创作者和开发者的痛点上。
但问题来了:
30 秒到底稳不稳?镜头衔接会不会穿帮? 50 个素材一次性丢进去,模型到底听谁的? 局部编辑真的能“定向修改”而不崩掉整条视频? 所谓的“去油腻感”和“影视质感”,到底是真进步还是营销话术?
模型刚一开放,创作者们便开始拿增加的 15 秒导演了起来。

但视频变长以后,漏动作和重新生成的成本也跟着上来了。Seedance2.5生成30秒、720P分辨率的视频需要780积分,折合单秒价格是2.1元;超长视频(180秒)的单秒价格更贵,差不多是2.35元/秒。此前,Seedance2.0 1080P分辨率的每秒价格是1.38元。

那么,涨价后的 Seedance 2.5,其性价比究竟如何?AGI-Eval 评测社区将通过一系列实测,为您揭晓答案。
看完最近比较火爆的科幻大片蜘蛛侠,AGI-Eval 也让seedance2.5生成一个皮特城市跑酷视频,大家请欣赏。
prompt: 【任务目标】 生成一段40秒、16:9、24fps的写实电影级纽约都市动作短片。 人物是一位女性角色,具备蜘蛛侠式发射蛛丝和高空摆荡能力,不出现Marvel、蜘蛛侠文字或品牌标志。 参考@1b7ae201-b275-4a8e-8a09-77eafec8c880为人物脸部身份基准,参考@fc5835c2-bbb5-403a-a4eb-36f00f23aaaf为全身造型基准。 严格保持参考图1中的本人脸部特征:脸型、五官比例、眼距、鼻形、 嘴形、肤色、瞳色和年龄感完全一致。人物修长腿部比例,身材纤细健康、具有真实运动力量。 造型全程固定:黑色皮质风衣,黑色皮质手套,黑色靴子。全程严禁换装、变发型或改变五官。 室内场景是 纽约高层公寓的凌乱卧室,窗户位于画面中央。 房间里有书桌、书架、海报、衣物和没有整理的床。 窗外是傍晚黄昏晚霞笼罩下纽约下东区/SoHo老红砖街区、黑色消防梯和屋顶天际线。真实室内与自然光交织,带有轻微胶片颗粒。 0.0—1.3秒:35mm宽幅中远景。室内暗淡与窗外傍晚彩霞形成明暗对比。她坐在高层公寓打开的窗台中央,大号白色耳机挂在脖子上,姿态放松看侧面。随即自然转头看向镜头,平静轻声说:“Come with me.” 1.3—2.3秒:她顺手将白色耳机摘下扔到一旁,闭眼微呼气,毫不犹豫地向后倒出窗外,落向城市深处。动作干净自然,镜头保持室内视场不变,直至她完全消失在窗外下沿。 2.3—3.5秒:切至建筑外侧低角度仰拍。她沿红砖立面自由落体下坠,短发和皮衣受真实风力吹扬。她核心收紧,迅速抬起右手腕,向对面建筑发射一束清晰的银白蛛丝。 3.5—5.0秒:蛛丝受力绷紧,改变其坠落轨迹。她沿光滑弧线低空掠过湿润街道,离地仅数米,向前方城市深处高速摆荡离开。 5.0—10.0秒:动作匹配切至右手露指手套极近特写:手腕侧甩,再次向右上侧发射蛛丝。镜头拉开为背侧跟拍,她以极低弧线贴着雨后黄色出租车车顶掠过,湿路面倒映出其高速飞过的暗黑影姿。 10.0—18.0秒:她主动解开蛛丝,身体倾斜45度贴在红砖公寓外墙上连续快速墙跑三步,长靴蹬踏湿润砖面飞溅微小水珠。顺势单手抓住黑色金属消防梯横杆滑荡过弯,消防梯产生真实物理震动,随后她再次向街角发射蛛丝。 18.0—25.0秒:路口侧面大镜头。蛛丝将她水平拉过繁华十字路口,她收紧双腿从两辆行驶的黄色出租车缝隙间穿过。前景出租车短暂遮挡镜头形成自然电影切镜。 25.0—32.0秒:中近景侧后跟拍。她快速下沉,单长靴踏上一辆黄色出租车车顶完成微秒级极短低姿态借力,车身悬挂轻微下压、积水向后飞散。她借助车速与腿部爆发力蹬离并再次射出蛛丝飞升。 32.0—40.0秒:低角度仰拍镜头跟随蛛丝拉力将她沿红砖楼立面垂直拉向天空。接近屋顶时她松开蛛丝,利用余速腾跃过一座木质纽约屋顶水塔,短发在阳光与蒸汽中向后扬起。最后停留在高空背影向曼哈顿远景摆荡跃去的画面,留足续接余韵。 摄影:变形宽银幕镜头、真实胶片颗粒、自然景深与符合快门速度的运动模糊。视角包括室内固定镜头、低角度仰拍、背侧跟拍与侧面大景别。镜头切换严格维持人物运动方向与空间连续性。后30秒减少正面特写,侧重于动作流线与背影。 物理:重力加速度真实,蛛丝具有明确受力点与张力弧线;落脚、抓握、拉升均带有肌肉发力与力量缓冲;皮衣、短发对风力和转向产生真实惯性反应。 音频:室内风声与远处交通底噪 → 摘下耳机的轻响与轻声“Come with me” → 高速破风声与清脆蛛丝“thwip”发射声 → 踩击车顶与金属震动声。


实测评估:
本次复杂的动作序列测试,暴露出模型视听维度的巨大能力鸿沟。值得肯定的是,其角色一致性表现稳定,长达40秒的复杂动作中主角的核心特征得以保持;音效设计也颇为出色,音频完成度高于视觉部分,构建了层次丰富的音景。然而,较低的指令遵循度导致了视觉执行的一系列问题:物理逻辑上,多个镜头缺失蛛丝着力点;时空与剪辑上,存在镜头衔接不够自然和场景重复的情况;风格模拟也未能充分还原“攀岩走壁”的精髓;同时细节质感上,蛛丝的视觉效果也略显粗糙。
prompt: 16:9宽幅电影级质感,超写实。京剧舞台表演,一镜到底,丝滑运镜,大光圈浅景深,低调光影,人物始终清晰。镜头先环绕霸王,展现用髯、抖甲、云手、跨步亮相、旋身翻转等武生程式动作;随后自然转向虞姬,跟随她完成柔美水袖、转身与收袖定格;最后镜头后拉至舞台全景,霸王、武生、虞姬形成三角站位。00:00-00:05近景贴近霸王脸谱与眼神,缓慢环绕上半身。霸王做武生程式动作:甩髯、抖甲、云手转身、跨步亮相、旋身翻转。镜头保持中景半环绕,随后霸王快速掠过镜头形成自然遮挡。00:05 -00:12镜头无缝绕至虞姬身侧,稳定中景跟随。她微侧身,双臂缓抬,水袖垂落后随手腕挑起展开;顺势半转,一袖掠胸前,一袖向后甩出成弧,最后收袖定格。00:12-00:20镜头无缝转向武生并缓慢后拉,三人始终居中。霸王、武生、虞姬成三角站位。最后拉至舞台全景,三人定格亮相。

实测评估:
本次“一镜到底”的京剧表演测试,清晰地展现了模型艺术表现力的优势,同时也暴露了其指令遵循和时空连续性上的一些不足。模型艺术表现颇具亮点,例如通过失焦模拟镜头的“呼吸感”,并自发设计慢动作以增强水袖的柔美感。然而,核心的“一镜到底”要求因人物“闪现”而中断,部分运镜及结尾动作也与指令不符,且全景镜头下人物面部清晰度有所下降。
prompt: 30秒电影级末日短片:黄沙覆盖的废弃城市中,一个孤独的无线电工程师爬上即将倒塌的信号塔,试图发出人类最后一条求救信号。远处风暴逼近,城市废墟中闪烁着零星灯光。就在他接通电源的瞬间,耳机里传来另一个陌生幸存者的回应。镜头真实、压抑、史诗感,末日灾难片质感,孤独但有希望。

实测评估:
本次测试充分展现了模型电影感营造的出色能力,但也暴露了其叙事逻辑和指令精确性上的短板。模型氛围营造值得肯定,无论是镜头语言、影调还是音效设计,都完美契合了“末日灾难片”的质感。然而,较低的指令遵循度也导致了一系列问题:开场镜头缺失主角造成叙事断裂,角色情绪递进不合逻辑,且未能准确表现“即将倒塌”等视觉指令,甚至主角面部还存在潜在的肖像权风险。
此部分评估模型从多张图片、视频、音频中提取并融合元素的能力,以及在多人同框、群像叙事等复杂场景中的稳定性。
此前 Seedance 2.0 最多支持单任务上传 9 张参考图,而 Seedance 2.5 把这个数值直接拉到了 50 个参考素材(可以是图片、视频或音频,也可以是 3D 白模)。我们上传了 12 张图片进行测试:


prompt: 30 秒音乐会片段,16:9 横屏,电影感写实,真实音乐厅光影,暖金色舞台灯,正式古典音乐会氛围。场景@图一,钢琴家参考@图二,大提琴手参考@图三,小提琴手参考@图四,主唱参考@图五,指挥、长笛手、竖琴手参考@图六到图八,合唱团参考@图九到图十,观众席参考@图十一到图十二。主唱舞台中央走向前沿,钢琴家在钢琴旁,乐队分布两侧与后方,合唱团在舞台后方。开场高位俯拍音乐厅全景,钢琴家落键,主唱进入追光演唱,镜头自然带过小提琴、大提琴与管弦乐队,小提琴明亮,大提琴温暖。后段合唱团加入,主唱与第一排观众短暂眼神交流,观众微笑点头。结尾镜头后移,演唱结束,观众跟随鼓掌。

实测评估:
本次多模态参考测试,展现了模型宏观艺术指导的才华,但其微观逻辑执行却出现了明显失误。值得肯定的是,模型氛围营造和叙事构建表现出色,甚至展现出优化指令的“导演思维”,音画结合也颇为精准。然而,多主体场景下出现了严重的“人脸复制粘贴”,破坏了角色一致性。此外,画面暗部噪点、声画不同步以及部分细节指令被忽略等问题也同样存在。
此功能值得单独拆解。用户可上传无纹理 3D 白模预演视频,定义空间结构、人物姿态、运动轨迹和镜头机位,模型再按照这套结构生成最终画面。我们找了一个白模 case 演示:

prompt: 以白模参考视频作为整支视频唯一的运镜、镜头节奏、景别变化、主体运动轨迹和镜头调度参考,生成一部15秒AI未来科幻废墟城市中的游戏视频。整体基调偏赛博朋克,角色外形各阶段保持一致,不要改变角色形象。

实测评估:
本次白模控制测试,其结构遵循表现尚可,但渲染与物理模拟层面存在明显不足。模型较好地复现了白模预设的轨迹与调度,角色一致性稳定,部分音效细节也处理得不错。然而,成片存在严重的掉帧和不自然的物理滑动,场景渲染缺乏细节,质感如同色块涂抹。同时,服装设计有“取巧”之嫌,BGM也被环境声生硬取代,影响了整体效果。
此部分评估模型对已生成视频进行局部修改、延长和重新剪辑的能力。我们上传了一段视频,进行定向编辑测试。
prompt: 把地上的中间是珍珠的白色小花改成中间是蓝色钻石的蓝色小花,把毡毛小松鼠改成毡毛小猫,松果变成胡萝卜。其他所有内容保持不变,风格不变。视频延长至15s,他们看着的地方冒出一只探头的毡毛小狐狸。

实测评估:
本次编辑测试,模型创意融合表现出色,但指令执行精准度不足。值得肯定的是,编辑后的内容与原片艺术风格高度统一,并能智能生成匹配的音效,新增元素的光影整合也十分自然。然而,指令执行层面,模型对语义的理解出现偏差,如“钻石”被渲染成“珠子”,“替换猫”仅变为“修改尾巴”。此外,编辑后还出现了动画细节退化和画质下降的问题。
此部分评估模型在真实产业场景中的应用价值。
prompt: 根据图片生成教学短片,讲解两个方程式的实验现象,注意实验操作规范,镊子不能伸进液体,浓硝酸比稀硝酸快,稀硝酸反应微弱,气体稀少


实测评估:
本次化学教学场景测试,模型表现出了基础的知识理解与规则遵循能力。值得肯定的是,它能够准确区分浓/稀硝酸的反应速率差异,画面呈现符合“浓硝酸快、稀硝酸微弱”的描述。同时,模型也遵循了“镊子不能伸进液体”这一关键的操作规范,证明其具备初步完成简单教学演示的能力。
prompt: 一镜到底,超写实废墟电影风格。场景一开始几乎全黑,人物全程坐着不动。突然斜上方一块破旧木板掉落,灰尘和碎屑落下,屋顶露出一个狭窄洞口,一束自然光从上方斜射进来,空气中的灰尘颗粒被光束清晰照亮,在光柱中缓慢漂浮。光线照射到人物脸上。人物被刺眼强光照到后自然眯起眼睛,迅速抬手挡脸,同时抬头看向洞口。手掌挡住大部分光,但指缝间漏出细小明亮的光线,落在额头、眼周、鼻梁和脸庞上,并随手部轻微移动连续变化。要求木板掉落后的光线出现、体积光、灰生、脸部受光、眯眼反应、手部遮挡、指缝透光、墙面和地面局部亮度变化始终逻辑一致,整体曝光稳定,不要乱跳,不要随机贴图感。

实测评估:
本次测试揭示了模型能力的显著“两极分化”:微观渲染能力很强,但宏观逻辑控制能力薄弱。值得肯定的是,模型画质提升、细节刻画(如漂浮尘埃)和复杂光影交互上达到了惊艳的写实水平。然而,这些亮点无法掩盖其宏观逻辑上的严重问题,包括时空错乱(场景自愈)、逻辑失效(角色对刺激无反应),甚至将参考图中的鼠标箭头错误地渲染进画面。
prompt: 国产老电视剧视觉画风,古装侠客,负伤后踉跄逃跑,右手捂着左臂伤口,呼吸急促,表情疼痛单晶体回头看追兵,身体重心展现出“随时会倒但必须撑住”的感觉。

实测评估:
本次测试中,模型风格模拟和状态表现展现了出色能力,但镜头语言和叙事连贯性则表现不佳。值得肯定的是,模型通过喘息、细汗等细节,成功传达了角色“随时会倒但必须撑住”的负伤状态,并且准确复现了老电视剧的视觉风格。然而,视频叙事上存在空间割裂,追兵与主角的镜头缺乏有效联系,部分镜头的运用也显得意义不明。
prompt: 【场景】傍晚的厨房,油烟机低鸣,灶上汤在小火慢炖,蒸汽模糊了窗玻璃。 【主体】【母亲】背对镜头切菜,肩膀绷着;【女儿】坐在餐椅上抱着手机,眼睛没在看屏幕。 【运动】女儿张嘴说话时母亲刀没停;母亲回话时手慢了一秒;镜头从侧面静止凝视,两人始终没有对视。 【音频】[女儿,试探性,像扔一颗石子探水深]:"妈,我想换工作。" [切菜声停了一拍又继续] [母亲,声音控制得很平]:"吃完饭再说。" [沉默,汤咕嘟一声] [女儿,更小声]:"你能不能先听我说完。" [切菜声停了。彻底停了。]

实测评估:
本次测试精准地揭示了模型静态氛围营造与动态叙事节奏之间的巨大鸿沟。值得肯定的是,模型成功搭建了一个充满生活质感和电影感的“舞台”,对压抑氛围和人物微表情的刻画也颇为出色。然而,关键的对话节奏与表演逻辑却近乎完全失败,模型未能理解对话中的停顿和潜台词,导致戏剧张力被破坏,且存在场景逻辑崩坏、指令遵循偏差等问题。
30 秒叙事站住了,3D 白模打开了专业工作流的想象空间,局部编辑让“改一处不用重来”成为可能。但人脸复制、色彩噪点、声画不同步、指令遗漏——这些问题在长视频和多人交互场景中依然高频出现。而 2.1 元/秒的成本,也让每一次“抽卡”都更有分量。
Seedance 2.5 提升的是“上限”,而非“性价比”。 它为高品质创作提供了可能,但也要求使用者在效果与成本之间做出更精明的权衡。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。