Seedance 2.5 提示词指南:官方公式、素材职责模板与符号语法
我用 Seedance 生成过 200 多条视频。其中很长一段时间,我都被一个说不清的问题卡着。
同一条提示词,出 5 秒的片子干干净净,拉到 15 秒就散架。人物会变脸,镜头会自己跑偏,光线过了一半莫名其妙就变了。
我一直以为是模型的问题。不是。是我的问题——我在用写 5 秒片子的方式写提示词,然后指望它撑住 15 秒。
直到字节公开了 Seedance 2.5 的企业级实践手册,也就是他们商业化团队自己在用的那份文档。第一遍读完,我之前所有的失败都有了解释。不是"要写得详细一点"这种空话,是一条真正的公式、一套给参考素材分派职责的模板,以及一个硬性的上限——喂多少素材之后,模型反而开始稀释你真正在意的东西。
Seedance 2.5 的 API 8 月 7 日全量开放。下面是那份手册里的内容,最有用的放前面。
为什么用 2.0 的写法写 2.5,一定会崩
2.5 变了两件事,两件都在破坏旧习惯。
片长翻倍了。 Seedance 2.0 单段上限 15 秒,2.5 是 30 秒直出、无需拼接。这听起来是纯赚,确实也是——但一条写成流水句的提示词,撑不住 30 秒的骨架。空出来的部分模型会自己填,而它填得很糟。
参考素材的额度暴涨。 2.0 只收 9 张图、3 段音视频。2.5 收 50 个素材:30 张图 + 10 段视频 + 10 段音频。空间变大只有在你说清楚每个文件干什么用的时候才是优势。传 8 张图什么都不说,模型只能自己猜哪张是人物、哪张是背景、哪张只是风格。
下面所有内容,都在解决这两个问题。
官方提示词公式
手册只给了一条公式。六个部分,不需要的可以直接省略:
主体 + 动作或事件 + 场景与环境 + 视觉风格 + 运镜或切镜 + 声音
每一部分具体在管什么:
- 主体 + 动作 —— 谁或什么,正在做什么。这是地基。动作优先概括主要过程,只给关键动作写细节,别把同一个动作换三种说法重复描述。
- 场景与环境 —— 地点、时间、天气、空间关系、背景状态。
- 视觉风格 —— 光线、色彩、材质、画面质感、整体氛围。
- 运镜或切镜 —— 景别、机位、镜头运动、对焦对象、镜头怎么衔接。
- 声音 —— 对白、音色、环境声、音效、音乐。
公式落成模板长这样:
<主体>在<场景与环境>中<主要动作或事件>。
画面呈现<视觉风格>。
镜头采用<景别、机位、运镜或切镜>。
声音包括<对白、环境声、音效或音乐>。填满之后的样子(改编自官方手册):
一名陶艺师在清晨的工作室里完成一只浅蓝色陶杯,将它从转盘上取下并放到木架中央。
窗外柔和晨光照入室内,湿润陶土呈现细腻光泽,工作台保持整洁。
镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理,最后切到木架正面。
保留转盘低沉转动声、陶土摩擦声和轻微室内环境声。注意里面没有什么:没有分辨率、没有帧率、没有画幅。生成参数不该写进提示词。 那些在生成页面或接口里设置。写进提示词只是给模型增加需要忽略的噪声。
30 秒怎么写:拆成时间段

这是收益最高的一个改动。
不要把 30 秒当一个想法写。要拆成带明确时间戳的段落。手册里所有长片示例都是这么写的——科普片、广告片、多房间跟拍长镜头,一条不落。
写法是这样:
0-3s [画面是什么] [镜头怎么动] [台词或声音]
3-8s ...
8-14s ...一段科普片,改编自官方手册:
生成一条科普视频,讲月球是如何诞生的。画面质感要有电影感,视觉效果要强,
在爆炸与汇聚的过程中要有视觉张力,要符合科学事实。
0-2s:太空远景,画面下方是地球弧面与蓝色大气层,上方远处有一颗暗红色小天体
悬在黑色宇宙中,镜头基本静止。
2-3s:切到近景,一颗表面布满橙红熔岩裂缝的巨大天体靠近地球边缘,镜头静止,
天体压迫感增强。台词:"45 亿年前,地球被一颗火星大小的天体撞击。"
3-5s:熔岩天体撞击地球边缘,强烈白橙色爆光从接触点喷发,大量炽热碎片沿地球
表面向外飞散,镜头跟随爆炸冲击连续推进。
5-8s:撞击后的炽热物质在太空中汇聚成发光的橙红熔融球体,周围有碎片与尘埃盘
旋,镜头由近到远缓慢拉开。它之所以成立,靠三件事:
- 时间戳强制了节奏。 不给时间戳,模型自己决定每个想法占多久——而它决定得很差。
- 每一段都写了镜头。 不只是画面里有什么,是这一段镜头在做什么。
- 台词挂在具体的段落上,不是堆在提示词末尾。
如果这篇你只带走一条,就带这条。
给每个参考素材分派职责

用 @ 符号引用素材——@图片1、@视频1、@音频1。这个大家都知道。
几乎没人做的是真正关键的那一步:每引用一个素材,都要紧跟一句它提供什么。 手册在这一点上写得很直白:不要出现"参考 @图片1"这种无头无尾的写法,也不要依赖图片里的文字标注,更不要让模型自己判断多份素材分别对应哪个人物、道具或场景。
模板:
@图片1用于<主体>的<外貌、服装、结构或材质>。
@视频1用于<动作、运镜或节奏>。
@音频1用于<角色或声音类型>的<音色、台词、环境声或音乐>。
<主体>在<场景>中完成<主要动作或事件>。
画面呈现<视觉风格>,镜头采用<镜头表达>。填满之后:
@图片1用于陶艺师的五官、发型和深绿色围裙,不采用图片背景。
@图片2用于陶艺工作室的木质工作台、窗户位置和晨间光线,不采用图中人物。
@视频1用于双手拉坯、托起陶杯和放置陶杯的动作节奏,不采用视频中的人物身份、
服装和场景。那几句"不采用"是在干实活的。一张参考图会把它包含的一切都带进来——主体、背景、构图、色调。你只想要那件外套,就得说出来,否则连拍摄那件外套的房间一起给你。
还有一种情况值得背下来。 当多张图是同一个物体的不同角度时,必须明说:
@图片1定义同一盏折叠台灯的正面外观。
@图片2定义同一盏折叠台灯的左侧结构。
@图片3定义同一盏折叠台灯的右侧结构。
三张图片共同定义同一盏折叠台灯,成片中始终只有一盏折叠台灯。漏掉最后那句,你可能会拿到三盏台灯。
四个特殊符号:分开控制音乐、音效、台词和字幕
自然语言直接写就能用。但当你需要把音乐、音效、台词、字幕分开控制时,Seedance 有专门的符号。下面这张对照表出自字节官方实践手册:
| 你要什么 | 符号 | 示例 |
|---|---|---|
| 音乐 | ( ) | (背景播放舒缓节奏的钢琴乐) |
| 音效 | < > | <远处传来钟声> |
| 台词 | { } | {你好,欢迎回来} |
| 字幕 | 【 】 | 【第一章:启程】 |
也可以直接把声音关掉,这比祈祷模型不加靠谱:
无背景音乐,只保留人物对白、环境声和动作音效。
不要字幕。
不要任何声音。台词不是中文时,要在台词前明确语言。 Seedance 2.5 原生支持 10 余种语言——中文、英语、西班牙语、印度尼西亚语、马来语、泰语、阿拉伯语、葡萄牙语、越南语、日语、韩语——手册推荐的公式是:
台词语言 + 地区变体或口音 + 表达方式 + 说话人 + {台词内容}
女孩用日语轻声说:{もう大丈夫です}
台词语言:地道的洛杉矶美式英语。年轻男子用自然的洛杉矶口语说:
{No way, you actually made it.}这也是那个高频问题的解药——你写了英文台词,模型却说成中文。把语言写明确,问题就没了。
负向提示词同样支持。官方那条家居改造的案例,结尾就带了完整的负向段落:
Negative Prompt:不要改变房间布局。不要移动家具。不要增删物体。
不要改变镜头运动。无人物、无文字、无 logo、无闪烁。人物为什么会漂移:素材配比规则

这一节回答了我最初那个问题,所以我给它多一点篇幅。
Seedance 2.5 收 50 个参考素材。那是上限,不是目标。字节自己的评测结论是:超过某个点之后,多传素材会让结果变差——关键特征被稀释,噪声增多。
具体数字:
| 主体素材是…… | 建议 | 上探 |
|---|---|---|
| 音频或视频 | ≤ 5 个主体 | 确有需要可试 6–10 |
| 图片 | ≤ 8 个主体 | 确有需要可试 9–12 |
单段时长和数量一样重要。 单个视频、音频参考控制在 5–10 秒,这是识别度与稳定性的最佳区间。2 秒太短,信息量不足、特征不完整,模型锁不住;30 秒则会稀释掉你真正在意的特征,还带进一堆噪声。
单视图还是多视图:
- 主体图 ≤ 5 张时,单视图、多视图都行。
- 超过 5 个主体时,单视图更稳定。
- 需要多角度就拆成多张分别上传,不要传一张里面拼了多个视角的图。
素材超载时,按这个优先级取舍:
核心角色 > 关键产品与道具 > 场景环境 > 整体风格
风格是第一个该砍的。但它往往是大家最先保的那个——正好反了。
顺便把硬性上限也列全:
| 数量 | 体积 | 格式 | 时长 | |
|---|---|---|---|---|
| 图片 | 0–30 张 | ≤30MB,4K 以内 | jpeg、png、webp、bmp、tiff、gif、heic、heif | — |
| 视频 | 0–10 个 | ≤200MB,480p–4K | mp4、mov | 单个 2–30s,总计 ≤30s |
| 音频 | 0–10 个 | ≤15MB | mp3、wav | 单个 2–30s,总计 ≤30s |
视频和音频的时长是分开计算的——各 30 秒,不是加起来 30 秒。模态可以自由组合,共 7 种:只参考图片、只参考视频、只参考音频(2.5 新增),以及三者的各种组合。三模态同时使用时,还可以指定其中某张参考图作为首帧或尾帧。
8 条可以直接抄的提示词
以下全部改编自字节官方实践手册,换掉主体和场景就能用在你自己的项目上。
1. 30 秒无对白叙事
一段 30 秒的无字视觉故事,带着法国乡村的静谧优雅,发生在普罗旺斯某个夏日午后。
一位年轻女子身着米白色亚麻连衣裙,在石砌小屋内一张老木桌旁写完一封手写信,
随后走出门外,沿着碎石小径穿过向日葵花田,来到村庄边缘一个复古黄色邮箱前,
轻轻将信塞入其中。镜头从室内桌面的浅景深特写开始,穿过门廊——光线渐渐让位于
阴影——最终上升拉开,呈现出金色山谷的全景宽画面。全程只有环境音:蝉鸣、风声、
笔触纸面的沙沙声,以及邮箱轻轻合上的咔哒声。为什么成立: 整条路线被写成一条连续路径,镜头有明确的弧线——特写、穿过门廊、上升拉开。这是 30 秒不跑偏的关键。
2. 产品广告:影棚接生活场景
制作一支 30 秒竖屏家居广告。主产品为浅灰绿色模块组合沙发,圆润弧形线条,
低矮厚实坐垫,搭配米白毯和棕色抱枕。
前 15 秒为纯白无缝影棚产品展示:沙发完整陈列,镜头依次慢推近、水平横移、
侧向平移展示轮廓与形态,最后后拉至全景定格。布光均匀柔和,背景纯白干净,
不扫光、不闪白。
后 15 秒转入暖光客厅傍晚:女主人穿米白针织家居服坐在沙发上读书,腿搭米白毯;
轻放咖啡杯,猫跳上沙发;孩子跑入靠在肩上,女主人低头微笑;夜晚落地灯亮起,
三者安静靠在沙发上,镜头缓慢后拉定格,留出品牌标识空间。为什么成立: 两段之间有一个明确的转折点。模型不用猜调性在哪里变。
3. 时尚短片:多素材组合
生成一条 30 秒的一镜到底视频,6 位模特依次接力入画,整段运镜穿梭到底,
配乐卡点切换造型。
@图片1 戴着 @图片2 在 @图片3 的场景中,音效参考 @音效1。
@图片4 穿着 @图片5,戴着 @图片6 的帽子,端着咖啡走出来,背景是 @图片7。
@图片8 在 @图片9 的场景中,穿着 @图片10 和 @图片11 摆 pose,音效参考 @音效2。为什么成立: 每个素材都有明确职责,没有留给模型推断的空间。
4. 3D 动画广告:逐段写
3D 动画广告风,色彩明亮通透,果肉和汁水要有强烈的清爽感与冲击力。整体气质
像高质量商业动画短片,带一点夸张幽默。沙漠角蜥角色可爱、灵动,表情丰富。
0-3s:画面一片被烈日暴晒的沙漠。空气热得扭曲,沙地发烫。一只沙漠角蜥趴在滚烫
的沙子上,舌头微微吐着,眼神涣散。音效:热浪呼呼声,轻微夸张的干裂声。
3-6s:角蜥突然停住,鼻子动了动。沙子里埋着一颗冰凉饱满、带着水珠的葡萄柚。
音效:"叮"一下的发现音效。
6-8s:角蜥一个飞扑冲过去,双手死死抱住葡萄柚,整张脸贴在果皮上。画面定住 1 秒。
音效:扑通一声,随后安静半秒。
8-11s:果皮裂开,里面饱满的果肉闪着透亮光泽。汁水不是流出来,而是像海啸一样
喷涌而出。音效:"咔嚓"咬开声,接一声夸张的果汁爆开声。为什么成立: 音效是逐段指定的。喜剧节奏能不能踩上,全靠这个。
5. 关键帧驱动的概念片
电影级品牌概念短片。@图片1 为首帧,画面微微晃动,镜头逐渐推近,来到窗外快速
后退的树影,树影后退速度越来越快,突然切到 @图片2,速度突然放缓,镜头顺着溪流
缓缓前进。镜头下移来到水下,音效有水中气泡的声音,一群橙色的水母从镜头前优美
地游过 @图片3,镜头缓缓后拉。为什么成立: 首帧被明确声明,每一次切换都锚定到具体素材上。
6. 编辑:删除主体
视频编辑:删除 @视频1 中的所有人,除了主角。整条提示词就这么长。编辑类指令本来就该是短的。
7. 编辑:重布整片光源
参考 @视频1 的光线,从正午刺眼的顶光,改为日落时的侧光。为什么成立: 它同时说明了当前状态和目标状态。写"打光好看点"什么也得不到。
8. 编辑:改演员的年龄和表情
保留 @视频1 的构图、机位、光线与表演节奏,只改写画面里女主的样貌与神情:
让她从二十多岁自然地老去到六十岁,眼神里的隐忍慢慢化开,泪光滑过眼角,
嘴角一点点扬起,最后破涕为笑。全程一镜到底,不跳切、不闪烁,五官随年龄
渐变而不漂移。为什么成立: 它先锁死"不能变的",再说"该变的"。这就是编辑类提示词的基本模式——展开还有不少讲究,我单独写在了Seedance 2.5 视频编辑与延长指南里。
常见问题
Seedance 2.5 能传多少个参考素材? 50 个:30 张图 + 10 段视频 + 10 段音频。单个视频、音频时长 2–30 秒,视频总时长 ≤30 秒,音频总时长另算 ≤30 秒。
Seedance 2.5 支持负向提示词吗? 支持。官方那条家居改造案例结尾就带了完整的负向段落,覆盖房间布局、家具位置、镜头运动和不希望出现的元素。
Seedance 2.5 支持哪些语言? 原生支持 10 余种,包括中文、英语、西班牙语、印度尼西亚语、马来语、泰语、阿拉伯语、葡萄牙语、越南语、日语、韩语。台词前写明语言,输出才稳。
能不能改我已经生成好的视频?
可以。把成片作为 @视频1 喂进去,描述要改什么,再加一句锁住其余部分。输出会严格对齐原片的画幅,时长基本对齐原片。
单段最长能生成多久? 30 秒直出,无需拼接,是 Seedance 2.0 的 15 秒上限的两倍。
Seedance 2.5 多少钱? 模型本身没有免费额度,开通门槛与 2.0 系列一致(账户余额 > 200 元,或已购 2.0 资源包且有余量),体验中心与 API 8 月 7 日全量开放。价格和 2.0 到底差在哪,我写在了 Seedance 2.5 和 2.0 的区别里。
写在最后
一条能用的 Seedance 2.5 提示词,和一条不能用的,差别就在三件事上。
把 30 秒写成带时间戳的段落,不要写成一句话。 每一段里都要有镜头指令。
给每个参考素材分派职责。 一句话说清它提供什么——以及不提供什么。
守住配比。 音视频主体 5 个、图片主体 8 个、单段 5–10 秒。50 个素材是上限,不是目标。
Seedance 2.5 要到 8 月 7 日才开放,但你不用等——这条公式、这套职责模板、这张符号表,在 Seedance 2.0 上今天就能用,你可以直接在 Tryonr 上用 Seedance 2.0 生成,无水印。在 2.0 上把习惯练对,2.5 开放当天你就是能干活的状态。
还在用 2.0?可以先看 Seedance 2.0 提示词指南。想了解模型本身,去 Seedance 2.5 模型页。
本文提示词改编自字节跳动 Seedance 2.5 官方实践手册。


