Seedance 2.5 发布:支持30秒长视频与多模态参考
一镜到底,灵活参考:Seedance 2.5 正式发布
一镜到底,灵活参考:Seedance 2.5 正式发布
日期
2026-07-31
分类
模型
今天,我们正式推出新一代视频生成模型 Seedance 2.5。自 Seedance 2.0 发布以来,我们观察到用户对视频生成模型的期待正在转变:从单纯生成片段,到完成一部完整的创意作品。基于 Seedance 2.0 统一的多模态音视频联合生成架构,Seedance 2.5 以基础生成和参考生成为核心,在长叙事、多模态参考和编辑方面实现了重大突破。立足真实应用场景,它释放了更广阔的创作想象力和控制力,进一步提升了生产力。
核心亮点包括:
单次生成最长 30 秒,支持多轮续写:Seedance 2.5 可一次性生成高质量、30 秒的音视频片段,并支持多轮扩展。同时,它优化了镜头切换和场景变化,增强了长视频的连贯性,并在图像、音频和运动质量上取得显著提升,呈现出比常见 AI 生成视频更自然、更精致的视觉效果。用户因此能够以一致的视听语言产出高质量的多分钟内容,一镜到底,让完整故事跃然眼前。
多模态参考全面升级:用户现在可以一次性输入最多 30 张图片、10 段视频和 10 段音频作为参考素材。模型还强化了多种参考能力,包括黏土渲染、动作和创意参考,使其能更精准地把握创作者的意图,实现跨越多个主体、场景和镜头变化的复杂构思。
更精准稳定的编辑能力:Seedance 2.5 提供时间戳级别的控制,可对音视频内容进行定向编辑,显著提升了效率和可控性。模型还增强了高级编辑功能,如绿幕、镜头视角和基于参考的编辑,以满足影视、广告等专业复杂领域的严苛要求。
随着长叙事、多模态参考和编辑能力的提升,Seedance 2.5 不再局限于更长的单次视频生成。该模型能更深入地理解创作意图,并以更强的控制力实现从创意到成片的完整旅程。现在,我们邀请您观看一部由 Seedance 2.5 端到端制作的创意短片。
您的浏览器不支持视频播放。今天,Seedance 2.5 已在即梦 AI、豆包 Pro 等平台上线,API 访问也将通过火山方舟(BytePlus ModelArk)即将推出。欢迎您试用并分享反馈。
项目主页:
https://seed.bytedance.com/seedance2_5
访问方式:
即梦 Web -> 视频生成 -> 选择 Seedance 2.5
豆包 Pro -> 视频生成 -> 选择 Seedance 2.5
30 秒长叙事与多轮扩展:一次生成完整故事
Seedance 2.5 将单次视频生成时长从 15 秒延长至 30 秒,并进一步强化了长视频中的叙事能力。在 30 秒内,模型能够组织多个逻辑连贯的镜头,让故事按起承转合自然展开,而非简单延续单一场景。例如,在一段歌手舞台表演的一镜到底片段中,模型完整呈现了歌手在化妆间与工作人员互动、穿过后台走廊、与舞者会合、一同登台表演的完整故事,而非仅仅展示走上舞台的瞬间。
您的浏览器不支持视频播放。T2V提示词:手持云台跟拍,一镜到底。镜头缓缓穿过厚重红色幕布的缝隙,进入一间暖色调的后台化妆间。一位年轻女歌手背对镜头,正在调整耳返,工作人员提醒她该上场了。她转身面向镜头,开始演唱城市流行乐。镜头后拉,跟随她穿过幕布进入昏暗的后台走廊,途中与舞者们自然互动;一名工作人员递给她麦克风。随后她与舞者登上舞台,镜头绕至后方,逐渐展现红黑配色的舞台设计、LED屏幕、聚光灯、烟雾和反光地板。镜头最终拉远至场馆全景,呈现座无虚席的观众、灯牌、荧光棒和欢呼的人群,捕捉演唱会青春洋溢、自由奔放的高潮时刻。
得益于模型的多轮扩展能力,用户可以在现有视频输出的基础上平滑追加后续镜头。在整个扩展过程中,模型能保持主角、环境和叙事节奏的一致性。这让用户能够一次性输出长达数分钟的视频,省去了拆分片段、反复拼接素材和修补转场的繁琐工作。
您的浏览器不支持视频播放。在视觉呈现方面,该模型实现了更流畅的镜头运动切换。主体在多组镜头切换间保持稳定,音画同步,从而生成高度连贯的长视频。例如,在一场京剧场景中,镜头跟随主角飘逸的水袖优雅地环绕摇移,主体与背景始终保持一致。水袖的摆动在空中形成自然的弧线,紧密贴合真实物理规律。 您的浏览器不支持视频播放。R2V提示词:扩展视频。从@Video 1的画面和主体继续,生成额外30秒片段,保持人物主体、场景、视觉风格和音效一致。小男孩抱着足球沿着火车车厢奔跑。地铁停靠后,侧门打开,他立刻冲了出去,男主角紧随其后追赶。两人跑过站台,来到街上,沿途惊扰了行人和车辆。男主角终于追上并抓住了他。男孩委屈地抬头。男主角的怒气渐渐消退,拍了拍男孩的头,露出无奈的笑容。
此外,针对AI生成视频中常见的过度人工感问题,Seedance 2.5系统性地优化了物体纹理、皮肤与眼部特征、光照及色彩饱和度等细节。该模型还最大程度减少了字幕和背景音乐中的不可控因素,最终输出效果高度接近实拍电影质感。R2V 提示词:16:9 宽屏,电影质感,单次连续拍摄,镜头运动平滑,无剪辑。场景参考:@Image 4。0–5秒:以@Image 2中霸王的特写开场,镜头缓慢环绕其上半身,并过渡到中景。霸王旋转转身,身体与背后的靠旗快速掠过镜头,形成自然的遮挡,镜头随之跟随至@Image 1中虞姬身侧。6–10秒:镜头以中景稳定环绕@Image 1中的虞姬,跟随她的水袖划过弧线。她抬臂、抖腕、甩袖、半转身,随后收袖、定格,侧目望向霸王。11–20秒:@Image 3中的武生翻跟头入场。霸王居中,武生在对面进退攻防,形成打斗交流。虞姬站在霸王身后稍侧,穿插水袖动作,以柔克刚。镜头从武生的中近景缓缓拉远至全景舞台。结尾时,三人面向观众,摆出京剧亮相的同步定格姿势。
多模态参考全面升级,为复杂创意任务带来更强掌控力
Seedance 2.5 进一步强化了多模态参考生成能力。用户可在单次操作中输入多达 30 张图片、10 段视频和 10 段音频作为参考素材。更大数量、更多样化的参考能更精准地捕捉用户意图,从而生成包含更多主体、更丰富场景和更灵活镜头运动的复杂视频。
该模型能全面理解所有素材中的视觉构图、场景、风格、角色和道具等元素,并按照指令将其应用于视频生成过程。即使在多角色同框或群体叙事等复杂场景中,也能保留多个角色的外貌和声音,同时保持每个主体的特征稳定。
您的浏览器不支持视频播放。Seedance 2.5 还增强了特定参考能力,包括黏土渲染、动作和创意参考,让用户能更精细地控制画面中的主体、动作和镜头运用。例如,通过黏土渲染参考,用户可以使用无纹理的3D模型构建场景的空间结构、角色姿态、运动路径和镜头角度。模型随后利用这一结构生成视频,确保复杂镜头的构图和场面调度与创作者的预期高度吻合。此外,Seedance 2.5 改进了光照控制,借助黏土渲染中的空间信息,生成符合物理规律的真实光照效果,如光源方向、色温、强度和阴影投射,使最终输出中的光影更加自然。 您的浏览器不支持视频播放。R2V 提示词:一段 30 秒的 16:9 横屏音乐会片段,采用电影级写实风格,呈现真实音乐厅的灯光与阴影,暖金色舞台灯光,营造正式古典音乐会的氛围。场地参考 @Image 1。钢琴家参考 @Image 2。大提琴参考 @Image 3。小提琴参考 @Image 4。主唱必须严格遵循 @Image 5。其余管弦乐队参考 @Images 6 至 10。合唱团参考 @Images 11 至 14。观众席参考 @Images 15 至 18。主唱从舞台中央走向前沿。钢琴家位于钢琴旁。管弦乐队分列两侧及后方。合唱团站在舞台后方。开场为整个音乐厅的高角度广角镜头。钢琴家按下琴键,主唱步入聚光灯下开始演唱。镜头自然掠过小提琴、大提琴和乐队,展现他们合奏的画面,小提琴音色明亮,大提琴音色温暖。后半段,合唱团加入。主唱与前排观众短暂眼神交流,观众报以微笑和微微点头。结尾镜头拉远,演唱结束,观众席响起掌声。
R2V 提示:参考 @Clay Render 1 获取镜头运动、节奏、景别切换、主体轨迹和场面调度;参考 @Image 2 获取角色设计、场景、材质、光照、色彩和童话氛围,并将白色模型渲染成一部梦幻、温暖、带有童趣幻想的3D动画短片。故事展开如下:飞越幻想天空 → 神话生物在云海中并肩翱翔 → 潜入海洋 → 与蝠鲼在深海穿梭 → 穿过时空镜像裂隙 → 从宇宙中摘取星辰 → 变回卧室 → 父亲掖好被子 → 绘本合上并定格在最后一帧。
更精准可靠的编辑能力,提升创意效率
在视频创作中,用户通常需要在生成过程中控制节奏,并在后期细化细节。动作发生的具体秒数、镜头切换的精确时机,以及某个片段中角色动作是否需要调整,都会对最终结果产生深远影响。更精准可靠的编辑能力让创作者能准确地将想法付诸实现,提高效率,并降低重复生成的成本。
Seedance 2.5 支持基于时间戳的精准内容编辑。在生成阶段,用户可通过提示词控制特定时间段的叙事、镜头视角、运动方式及整体节奏,使输出更贴合创作意图。生成后,用户还能对特定片段中的人物、动作或情节元素进行定向修改,同时保持编辑前后的一致性与真实感。
Seedance 2.5 还升级了多项编辑功能,如绿幕编辑、镜头视角编辑和参考编辑,以满足影视、广告等专业领域的严苛要求。以绿幕编辑为例,模型可在保持主体不变的前提下替换背景,讲述截然不同的故事。此外,它还能出色地渲染主体对新环境物理规则的反应,包括衣物的飘动方向、发丝状态、步态节奏和光影交互,确保主体与场景自然融合。
您的浏览器不支持视频播放。您的浏览器不支持视频播放。R2V 提示词:使用 @Video 1,渲染绿幕背景、障碍物、服装和配角。0–4秒:户外训练,将障碍物替换为岩石、砖块、轮胎和木箱。4–10秒:更衣室,队友送上鼓励。10–15秒:国际比赛,将训练杆替换为原始防守队员和门将,主角破门得分。整体写实风格,电影级画质。
R2V 提示词:编辑 @Video 1。保持人物、动作和视觉风格不变,仅调整镜头运动。15秒分段镜头方案:0–4秒,微距FPV镜头紧贴平底锅掠过,随后跟随弹起的吐司并快速摇向咖啡;4–7秒,推进并沿锅边横向跟踪,跟随煎蛋翻面落回原位;7–11秒,快速升至俯视角度,再匀速下降,扫过盘子和键盘;11–15秒,手持特写跟随双手快速横向甩动,然后推进早餐并拉至中景双人镜头。全程保持流畅、连贯、稳定。
深入更广泛的行业场景,持续探索真实价值
随着模型能力的不断进化,Seedance 2.5 正深入教育、制造等更广泛的行业场景。在教育领域,该模型已开始进入真实的学习环境。例如,Seedance 2.5 能将课程背后的历史背景、人物和故事情节转化为更生动、更具沉浸感的视觉内容。同时,它还能帮助教师更高效地制作教学视频,将抽象内容——如科学原理、历史事件、实验步骤——转化为动态演示。这不仅降低了教学素材的制作门槛,还实现了高度灵活的内容定制。
您的浏览器不支持视频播放。豆包学习应用“豆包课堂”场景示例
R2V 提示词:表现力丰富的东方绘画风格。南宋临安街头,几个孩童奔跑穿梭于热闹街市,口中念着“蓦然回首,那人却在,灯火阑珊处”。镜头跟随孩童奔跑,扫过繁华街景,随后上摇,露出 @Image 1 中的辛弃疾。辛弃疾回头,远处灯火阑珊处站着一个人影。整个镜头保持连贯。
在工业制造、具身智能、自动驾驶等领域,Seedance 2.5 正融入高度专业化的生产流程。该模型能生成高质量的合成视频数据,用于训练机器人的感知与操作能力。它还被应用于工业仿真、流程培训和设备演示。在自动驾驶方面,模型可模拟极端天气、复杂交通等长尾场景,为系统测试和训练提供更多样化的样本。
您的浏览器不支持视频播放。R2V 提示词:参考 @Clay Render 1 的运镜、构图、景别、空间关系、部件位置、模型结构、装配顺序和运动路径;参考 @Image 1 的材质、光照、色彩、反射和氛围,将黏土渲染转化为高端逼真的汽车装配序列。
总结与展望
Seedance 2.5 在理解与呈现真实世界方面迈出了重要一步,将视频生成从片段级输出提升至全面的创意工作流。同时,我们也认识到仍有改进空间,尤其是在复杂动作的物理合理性以及多主体互动场景的稳定性方面。
展望未来,Seed 团队将继续探索更连贯的叙事方式,提供更直观的生成与编辑体验,并进一步加深模型对真实世界物理规律的理解。我们希望 Seedance 模型能更加生动、更易控制,且更善于理解用户意图,帮助更多用户表达创意,同时持续探索并服务于更广泛的行业需求。