本文以即梦 AI 中的 Seedance 2.0 为例,讲解从上传图片、视频、音频素材,到通过
@图片1、@视频1等方式精确控制生成结果的完整流程。重点拆解提示词结构,并提供可直接替换使用的模板。
一、Seedance 2.0 到底强在哪里?
与单纯“文生视频”不同,Seedance 2.0 的核心是多模态参考:除了文本,还可以同时输入图片、视频、音频,让模型分别参考人物形象、场景、镜头语言、动作节奏和声音氛围。
官方说明显示,Seedance 2.0 支持文本、图片、视频、音频四类输入;一次创作最多可组合 9 张图片、3 段视频、3 段音频,并可生成 15 秒的高质量多镜头音视频内容。字节跳动 Seedance 2.0 官方发布说明
可以把它理解为:你不再只是在“描述一个视频”,而是在给 AI 一份小型导演包。
- 图片:锁定人物、服装、产品、场景、构图
- 视频:借鉴动作、运镜、节奏、转场
- 音频:借鉴配乐、环境声、旁白节奏
- 文本:定义每份素材应该承担什么职责,以及最终故事如何发生
二、从上传素材到生成视频:完整操作流程
1. 进入 Seedance 2.0
在即梦 AI 网页端进入“视频生成”,选择 Seedance 2.0 模型即可开始创作。官方同时列出了即梦 AI、豆包 App 和火山方舟体验中心等入口;不同平台的按钮名称可能略有调整。官方体验入口说明
2. 明确目标:先写“镜头任务”,再找素材
不要一上来就上传一堆参考图。先用一句话定义本条视频:
目标:为一款智能手表生成 15 秒竖屏新品广告,突出金属质感、运动能力和轻量佩戴感。
这一步决定你需要哪几类素材。以智能手表广告为例,推荐准备:
| 素材 | 用途 | 建议 |
|---|---|---|
| 产品图 | 锁定手表外观、颜色、表盘 | 干净背景、主体完整、清晰度高 |
| 人物图 | 锁定佩戴者形象和服装 | 单人、半身或全身、光线稳定 |
| 场景图 | 锁定跑道、城市夜景等环境 | 构图明确,少用杂乱拼图 |
| 动作参考视频 | 借鉴跑步动作或镜头推进节奏 | 3~8 秒即可,动作要清楚 |
| 音频参考 | 参考节拍或氛围 | 避免版权不明的音乐素材 |
3. 上传素材并确认编号
上传后,输入框附近通常会将素材标识为“图片 1”“视频 1”“音频 1”等。后续提示词必须按界面显示的名称引用,例如:
@图片1
@视频1
@音频1
这里有一个关键原则:
@引用不是装饰符,而是“素材—职责”的绑定关系。每一份参考素材都要说明“参考什么”和“不参考什么”。
例如:
@图片1 仅用于保持手表外观、材质和表盘设计一致;
@视频1 仅参考人物跑步动作和由低到高的跟拍节奏;
不要复刻 @视频1 中的人物外貌、服装、场景和品牌标识。
这样写能显著减少“人物被视频参考带跑”“产品外观发生变化”等问题。
4. 选择生成参数并提交
根据内容投放渠道选择横竖画幅:
- 抖音、小红书、视频号:优先竖屏
- B 站、公众号、官网 Banner:优先横屏
- 电商主图视频:先确认平台尺寸规范
建议第一轮不要追求“直接出片”,而是先验证三件事:
- 产品或人物是否稳定;
- 镜头语言是否接近预期;
- 动作与音效是否匹配。
第一版通过后,再围绕单一问题迭代。例如“保持产品不变,只把镜头改成环绕推进”,不要同时推翻人物、场景、动作和风格。
三、提示词的正确写法:把“想法”写成“可执行镜头”
很多生成失败,不是模型不够强,而是提示词像一句广告文案:
一款高级智能手表广告,很酷,很有科技感。
这类描述缺少主体、动作、镜头、节奏和约束,模型只能自由发挥。
Seedance 2.0 更适合使用下面这个结构:
参考素材职责 + 主体 + 场景 + 动作/事件 + 镜头语言 + 视觉风格
+ 声音设计 + 时间/转场节奏 + 必须保持/必须避免
可以记成一个公式:
谁 + 在哪里 + 做什么 + 怎么拍 + 什么质感 + 听到什么 + 哪些不能变
1. 主体:先锁定“谁”
主体描述不要只写“一个女生”,而要写清能影响连续性的特征:
一位二十多岁的短发女性跑者,健康小麦肤色,穿深灰色运动背心和黑色短裤,
左手佩戴银色圆形智能手表。
如果上传了人物图和产品图,则改为:
人物使用 @图片2 中的角色形象,手表严格保持 @图片1 的外观、银色金属表壳、
黑色硅胶表带和圆形表盘设计。
2. 场景:说明空间关系,而不只给风格词
不推荐:
高级城市夜景。
推荐:
清晨的城市高架跑道,远处玻璃幕墙反射蓝紫色晨光,
跑道边缘有连续引导灯,背景行人保持虚化,不抢占主体。
“空间关系”越清晰,模型越不容易把人、产品、背景拼成互不关联的画面。
3. 动作:用连续动作链替代抽象词
不推荐:
女孩很酷地跑步。
推荐:
她从静止状态起跑,右脚先迈出,手臂自然摆动;
镜头跟随她跑过一段弯道;她抬起左手查看运动数据,
随后加速冲向画面前方。
动作最好按照时间顺序写,特别是多人互动、复杂运动、产品演示。
4. 镜头语言:明确“谁在动”
提示词里最容易被忽略的一点是:到底是人物在动,还是镜头在动?
开场为手表表盘微距特写,镜头缓慢推近;
切换至低机位侧后方跟拍,跟随人物起跑;
人物抬腕时,镜头快速推进至手表特写;
结尾镜头环绕手表半圈并停在品牌展示位。
常用镜头词可直接复用:
微距特写、低机位、俯拍、航拍、侧向跟拍、手持感、
缓慢推近、快速拉远、环绕镜头、焦点转移、延时摄影、
定镜、慢动作、匹配剪辑、无缝转场
5. 声音:把音效写进镜头,而不是只写“配乐”
Seedance 2.0 支持音画协同,因此可以把声音当作镜头的一部分描述。官方也特别提到其支持背景音乐、环境音、人物解说等与画面节奏同步的音频输出。官方音视频能力介绍
开场只有轻微风声和跑鞋落地声;
人物起跑后进入节奏感强的电子鼓点;
手表特写时加入清脆的界面提示音;
结尾音乐收束,保留一秒城市环境声。
如果上传音频素材:
@音频1 仅参考鼓点速度、能量变化和收束节奏,
不要直接复制其中可识别的歌词或人声内容。
四、@引用参考素材:最实用的写法
1. 一张图:做“首帧”或主体锚点
适用场景:产品广告、角色一致性、海报动效。
以 @图片1 作为首帧和产品外观参考。
保持手表的颜色、表壳比例、表带材质、表盘布局不变。
镜头从产品正面微距缓慢推近,表盘亮起,边缘浮现细微冷光。
背景为深灰色摄影棚,轻微雾化,电影级产品布光。
核心写法:
以 @图片1 作为首帧
保持 @图片1 中的【主体特征】不变
2. 一段视频:只借动作或运镜,不照搬人物
适用场景:舞蹈、运镜、转场、运动动作。
@视频1 仅用于参考人物奔跑动作、步频和侧后方跟拍节奏。
人物外观使用 @图片2,场景使用 @图片3。
不要保留 @视频1 中的人物脸部、服装、背景、文字和标识。
核心写法:
@视频1 仅参考【动作/运镜/节奏/转场】
不要参考【人物/场景/服装/文字/标识】
3. 多张图:给每张图分工,避免“所有都参考”
最常见的错误是上传 4 张图后只写“参考这些图片生成视频”。模型很难判断优先级。
推荐这样分工:
@图片1:作为分镜脚本,参考镜头顺序、景别和画面节奏;
@图片2:作为人物参考,保持脸部、发型、服装一致;
@图片3:作为场景参考,保留清晨城市跑道和蓝紫色光线;
@图片4:作为产品参考,保持手表外观和材质一致。
然后再补上生成任务:
基于以上素材创作一段 15 秒竖屏运动科技广告。
人物从 @图片3 的跑道起跑,佩戴 @图片4 中的手表;
整体镜头结构参考 @图片1,人物始终保持 @图片2 的形象。
这实际上是在给模型分配“导演、演员、美术、道具”四类职责。
4. 图 + 视频 + 音频:完整多模态案例
创作一段 15 秒、9:16 竖屏的运动智能手表广告。
@图片1 为产品参考:严格保留银色圆形表壳、黑色硅胶表带、
圆形表盘和金属反光质感,不出现其他品牌标志。
@图片2 为人物参考:保持短发女性跑者的脸部特征、身形、
深灰运动背心和黑色短裤一致。
@图片3 为场景参考:清晨城市高架跑道,蓝紫色晨光,
远景玻璃幕墙虚化,空气干净通透。
@视频1 仅参考低机位侧后方跟拍、跑步动作和人物抬腕查看数据的节奏,
不参考其中的人物、服装、文字、场景和品牌元素。
@音频1 仅参考电子鼓点从弱到强的节奏结构和结尾收束氛围,
不直接复制歌词或可识别的人声。
镜头一:手表表盘微距特写,表盘亮起,冷色边缘光。
镜头二:低机位跟拍人物起跑,鞋底落地与鼓点同步。
镜头三:人物在弯道抬起左手查看数据,镜头推进至手表特写。
镜头四:人物冲向晨光,产品定格在画面中央,留出干净字幕区。
整体为真实商业广告质感,金属材质清晰,运动自然,
转场利落,节奏由克制逐渐增强。
避免手表变形、表带消失、手指异常、画面中出现乱码文字。
五、提示词模板:直接替换方括号内容
模板 1:产品广告
创作一段 [时长]、[横屏/竖屏] 的 [产品名称] 广告。
@图片1 作为产品参考,保持 [颜色、材质、外观特征] 一致。
@图片2 作为人物参考,保持 [人物特征、服装] 一致。
@视频1 仅参考 [运镜/动作/节奏],不要参考其中的 [不需要继承的元素]。
场景:[地点、时间、环境细节]。
动作:[人物或产品按时间发生的变化]。
镜头:[开场镜头];[中段镜头];[高潮镜头];[结尾镜头]。
视觉:[光线、色调、材质、画面风格]。
声音:[环境声、配乐、音效、旁白]。
约束:保持 [必须稳定的元素];避免 [变形、乱码、无关标识等问题]。
模板 2:人物一致性短片
以 @图片1 中的人物作为全片唯一主角,保持脸部、发型、服装和年龄感一致。
以 @图片2 作为场景参考,保留其空间布局和主色调。
故事:主角先 [动作1],接着 [动作2],最后 [动作3]。
镜头从 [景别/机位] 开始,随后 [运镜],在 [关键动作] 时切到 [特写/俯拍]。
画面风格为 [写实/电影感/动画等],光线为 [具体光线]。
不要新增其他主要人物;避免脸部漂移、肢体异常和背景文字乱码。
模板 3:参考视频复用转场
@视频1 仅参考镜头之间的转场机制、运动方向和节奏,
不复制其中的人物、服装、场景、Logo、字幕或具体画面。
将主角设为 @图片1 中的人物,将场景替换为 @图片2。
视频开始于 [场景A],主角完成 [动作];
使用与 @视频1 相似的 [旋转/遮挡/快速平移/推拉] 转场,
进入 [场景B],最后以 [结尾画面] 收束。
整体动作自然、转场连贯、主体外观稳定。
六、生成不理想时,按这个顺序排查
1. 人物或产品“变了”
原因通常是主体锚点不明确,或者多个素材都在争夺主体定义权。
解决方法:
人物外观仅参考 @图片2;
产品外观仅参考 @图片1;
@视频1 不用于人物和产品外观参考。
2. 镜头没有按要求运动
不要只写“高级运镜”,应改成可观察的镜头指令:
镜头从低机位侧后方开始,以稳定器跟拍人物;
人物抬腕时镜头推进到手表特写;
最后环绕产品半圈后停住。
3. 动作不连贯、物理感不自然
将一个复杂动作拆成 2~4 个连续阶段,避免在同一句中堆叠大量高难度动作。
不推荐:
人物跳起、空翻、落地、换装、打开产品、冲向镜头。
推荐:
人物先快步跑向镜头;
在镜头前停下并抬腕;
镜头切换为手表特写;
最后人物转身继续向前跑。
4. 字幕乱码或品牌文字不准
视频模型对小字号文字、复杂排版仍可能不稳定。更稳妥的工作流是:
- 生成无文字的干净视频;
- 在剪映、CapCut、Premiere 或 After Effects 中后期添加品牌名、参数和 CTA;
- 只在提示词中预留字幕安全区。
画面下方保留 20% 干净留白,不生成可读文字或 Logo。
5. 多个参考素材互相打架
每份素材只能有一个主职责。建议采用“素材职责表”:
| 素材 | 只负责 |
|---|---|
| 图片 1 | 人物一致性 |
| 图片 2 | 场景和色彩 |
| 图片 3 | 产品外观 |
| 视频 1 | 动作与运镜 |
| 音频 1 | 节奏与氛围 |
七、一个专业创作建议:先做分镜,再生成
Seedance 2.0 很适合多镜头生成,但不代表应该把整支 30 秒广告一次交给模型。更稳的工作流是:
创意 Brief
→ 分镜脚本
→ 为人物/场景/产品准备参考素材
→ 每个镜头单独生成与筛选
→ 剪辑拼接
→ 后期加字幕、Logo、配音和调色
如果目标是稳定商用内容,建议把每个镜头控制在一个核心事件内。例如:
镜头 1:产品外观展示
镜头 2:人物佩戴并起跑
镜头 3:抬腕查看数据
镜头 4:产品定格与文案区
这样比“一个提示词生成完整广告片”更容易控制主体一致性、镜头节奏和后期可编辑性。
八、最后提醒:素材与肖像授权
上传参考素材前,应确认自己拥有图片、视频、音频的使用权;使用真实人物作为主体参考时,也要取得本人授权。Seedance 官方同样明确提示,真人肖像参考生成需要经过本人验证或事先取得合法授权。官方说明
总结
Seedance 2.0 的关键不是“写更长的提示词”,而是建立清楚的控制关系:
用图片锁定“长什么样”
用视频定义“怎么动、怎么拍”
用音频规定“怎么听、什么节奏”
用文字说明“每份素材参考什么、不要参考什么”
当你能熟练写出“@素材 + 职责 + 镜头事件 + 约束条件”的提示词时,Seedance 2.0 就不再只是一个随机出片工具,而更接近一个可以执行分镜的 AI 导演助手。
&spm=1001.2101.3001.5002&articleId=163537285&d=1&t=3&u=b4ea5996001946049da223c1a248b3e6)
4841

被折叠的 条评论
为什么被折叠?



