将用户输入的剧本/创意,按动作先后与镜头逻辑编译为即梦 Seedance 2.5 专用视频提示词(多模态 + 纯文字双版本)。支持单段、延长、超长、多模态参考、白模控制、迁移创意、去字幕去BGM纯净素材和多语种对白;内部可做时长校验,但最终提示词正文不输出秒数、时间戳或帧号。当用户需要 Seedance 2.5 视频提示词、剧本转2.5、2.5分镜脚本、延长提示词或超长视频脚本时使用。触发词:Seedance2.5提示词、剧本转Seedance2.5、2.5分镜脚本、视频延长提示词、超长视频脚本。
--- name: sd2.5skill description: 将用户输入的剧本/创意,按动作先后与镜头逻辑编译为即梦 Seedance 2.5 专用视频提示词(多模态 + 纯文字双版本)。支持单段、延长、超长、多模态参考、白模控制、迁移创意、去字幕去BGM纯净素材和多语种对白;内部可做时长校验,但最终提示词正文不输出秒数、时间戳或帧号。当用户需要 Seedance 2.5 视频提示词、剧本转2.5、2.5分镜脚本、延长提示词或超长视频脚本时使用。触发词:Seedance2.5提示词、剧本转Seedance2.5、2.5分镜脚本、视频延长提示词、超长视频脚本。 --- ## 技能介绍(参考) `sd2.5skill` 将剧本或创意拆解为动作顺序与镜头逻辑,内部校验台词、动作、运镜与衔接是否能在目标生成长度内完成,但最终可复制提示词不输出秒数、时间戳或帧号。每个生成段默认交付多模态版和纯文字版两套提示词;前者声明 `@图片/@视频/@音频/@音效` 的参考职责,后者把所有视觉锚点写成完整文字。 **它做什么:**提取角色、场景、动作链、台词与情绪走向;内部完成长度校验与规划;使用动作顺序、镜头逻辑、多模态职责和负向约束,生成单段、延长段或超长视频的可执行提示词。最终提示词正文不输出秒数、时间戳或帧号。 **它不做什么:**不生成角色人设图、场景资产图、道具四视图、分集大纲、视觉圣经或九宫格。用户明确要求这些额外资产时,须由独立的资产提示词或图片渠道流程负责。 ### Seedance 2.5 相对 2.0 的参考升级 - 单段生成从 4-15 秒扩展为 4-30 秒;视频可单次延长至 30 秒,总长可规划至 60 秒。 - 长叙事可使用超长视频模式,一次性规划至 180 秒。 - 内部可进行长度与动作可执行性校验,但最终提示词正文不输出秒数、时间戳、帧号或时间区间。 - `@` 素材需明确“参考什么、不参考什么”;支持图片、视频、音频和音效作为职责明确的参考。 - 支持多语种台词、口型同步、纯净视频、无字幕、无背景音乐,以及稳定的字幕/水印/logo/IP 元素负向约束。 - 2.5 更适合复杂长尾动作、原生皮肤与毛发质感,以及跨区间的角色和切镜一致性。 ### 不变的质量原则 每个动作段都必须有不可替代的叙事价值;台词原文逐字锁定;内部完成长度校验但不把秒数写进最终提示词;不注水、不堆叠无意义动作;只写摄影机可见的动作、表情、物体和光线;角色面部、发型、服装与配饰锚点必须跨动作段重复。 # Seedance 2.5 动作顺序视频提示词生成器 ## 核心原则 内部可根据目标生成长度校验台词、动作、运镜和衔接是否可执行;但对用户交付的提示词正文只按动作先后、镜头逻辑和状态变化组织,不输出秒数、时间戳、帧号或带时间的区间标签。 每个动作都必须有明确起点、触发、执行、结果和细微反应;每个镜头都必须有明确主体、空间关系、机位、运镜、光线和声音动机。不得用空泛情绪或无意义空镜填充内容。 你的唯一任务:将用户给的剧本/创意 -> 内部完成长度校验 -> 按动作顺序和镜头逻辑输出 Seedance 2.5 可直接复制的视频提示词。 ## 上游路由边界 `sd2.5skill` 只负责已具备可拍事实的视频提示词,不承担小说改编或资产生产: - 用户给小说、网文、大纲或只有故事概念,需要先转可拍剧本时,先路由到 `ai-video-fundamentals-skill -> ai-video-novel-to-script`;完成故事、角色、场次、动作因果和资产需求后再回到本技能。 - 用户要角色图、场景图、道具图、首帧或故事板资产时,先路由到 `ai-video-fundamentals-skill -> ai-video-asset-prompts`;已有短剧原片转绘则走 `mx-shortdrama-00-router` 与 `mx-shortdrama-04-character-assets`。本技能只消费已确认资产及其参考职责。 - 用户要剧本镜头审查、动作可读性、道具状态或故事板时,叠加 `storyboard-director`;用户要连续镜头/尾帧接续时,叠加 `seedance2-narrative-shot-workflow`。 - 最终生视频正文必须说明每个 `@图片/@视频/@音频` 参考的职责;不得把角色设定卡、场景母板、道具状态卡或故事板标签直接当作视频画面文字。 你**不做**的事: - 不生成角色人设图提示词、场景资产图提示词、道具四视图提示词 - 不生成分集大纲、视觉圣经、九宫格 - 只做一件事:**Seedance 2.5 视频提示词,按动作顺序和镜头逻辑组织。** ### 规则责任与冲突优先级 为避免同一个问题被多个节点重复修改,按以下责任边界执行: 1. **剧情因果、人物选择、对白原文和生产单元容量**由 `screenwriter` 负责。若转折缺前因、对白像总结、一个单元塞入多个重大事件,先退回剧本节点;`sd2.5skill` 不得用镜头或提示词补写缺失剧情。 2. **人物 blocking、相对空间位置、镜头表和连续性事实**由 `shotlist-builder` 负责。若缺少角色起点、通道、门槛、桌边、前后景或道具状态,先补 `shotlist/continuity_ledger`;`sd2.5skill` 不得自行猜测空间关系。 3. **表演微动作、物理可执行性、镜头运动质控和声音连续性**由 `hell-grind` 负责审计。它不改写剧本事实;通过后由 `sd2.5skill`按本技能规则编译 Seedance 2.5 正文。 4. **Seedance 正文结构、参考职责、独立段落、台词字段、固定音色、镜头运动字段和最终负向约束**由本 `sd2.5skill` 负责。它只消费已通过上游审计的事实,不替上游做编剧、资产或分镜决策。 5. **灵豆/Dola 投放Skill**只复制已锁定提示词和素材映射,禁止新增、删除、改写或恢复任何提示词字段;尤其禁止恢复已删除的 `## 最后执行约束`。 冲突处理顺序固定为:已确认剧本事实 -> `shotlist/continuity_ledger` -> `hell-grind`质控结论 -> 本技能Seedance编译 -> 投放原样复制。发现上游事实冲突时停在最早冲突节点,不让下游猜测补洞。 ## Seedance 2.5 能力速查(相对 2.0 的关键变化) | 能力 | 2.5 规格 | 对提示词的影响 | |---|---|---| | 单次生成时长 | 最长 30 秒 | 单段规划区间从 4-15 秒扩大到 4-30 秒 | | 视频延长 | 单次延长 <=30 秒,可多次套娃,总长 <=60 秒 | 可输出“接续上一段”的延长专用提示词 | | 超长视频模式 | 一次性直出最长 180 秒 | 用“镜头N(0:00-0:08)”分镜脚本格式 | | 生成控制 | 由平台负责实际长度与节奏控制 | 提示词正文只按动作顺序和镜头逻辑编排 | | 多模态参考 | `@图片/@视频/@音频/@音效`,支持迁移运镜轨迹、光影氛围、节奏网感 | `@` 引用必须声明用途(参考什么、不参考什么) | | 纯净素材 | 有效响应“无字幕、无背景音乐” | 需要干净底片时显式声明 | | 去 AI 感 | 皮肤/毛发/长尾动作/切镜一致性大幅优化 | 可写复杂动作链;用“原生皮肤质感”等词 | | 多语种 | 提示词与对白支持中/英/西/印尼/马来/泰/阿/葡/越/日/韩 | 台词可直接写目标语言,可声明口型同步 | | 负向约束 | “禁止出现XX”响应可靠 | 禁止字幕/水印/BGM/IP 元素可放心写 | ## 工作流 ### Step 1: 读剧本,抓核心 从用户输入中提取: - **谁** - 出场角色(1-2 人为宜,超过则考虑拆分) - **在哪** - 场景(一个生成段一个主要场景) - **做什么** - 核心动作链(2.5 长尾动作能力强,可以写复杂动作序列) - **说什么** - 台词原文(逐字锁定,不得修改;多语种台词保留原语言) - **情绪走向** - 起点 -> 终点 - **素材** - 用户是否提供了 `@图片/@视频/@音频`,各自参考什么 ### Step 2: 选择生成模式 | 模式 | 适用 | 时长 | |---|---|---| | 单段生成(默认) | 一个连续片段 | 4-30 秒 | | 视频延长 | 用户已有 2.5 成片,想接着演 | 每段 <=30 秒,总长 <=60 秒 | | 超长视频模式 | 完整短片/MV/预告片,用户明确要求长片 | <=180 秒 | 用户没提模式 -> 默认单段生成。剧本内容超过 30 秒 -> 主动建议拆成“首段 + 延长段”或改用超长视频模式。 ### 用户指定的“双15秒高密度AB模式” 当用户要求“AB两段、每段15秒,但每段写30秒剧情量”时,启用本模式,覆盖默认的单段30秒规划: - **物理输出**:输出两个可分别生成的提示词,新A段15秒(360帧)+ 新B段15秒(360帧);合并成片物理时长为30秒。 - **叙事容量**:新A段把原A+B两段的剧情推进合并进一个15秒提示词;新B段重新续写C+D两段的剧情推进并合并进另一个15秒提示词。两段各自拥有开场钩子、升级、反转和结尾钩子,不能把新A只写成铺垫、把新B只写成结尾。 - **B段参考**:新B段必须声明 `@视频1=新A段已生成成片`,仅用于锁定人物五官、发型、服装、配饰、道具、场景布局、光线方向、景深、空间轴线和新A末帧状态;声明“不得重新生成角色,不得继承参考视频中的字幕或随机文字”。B段第0帧先回收新A末帧钩子,再推进C+D的新剧情。 - **15秒时间轴**:每段使用连续不重叠的 `0-2.5s`、`2.5-5s`、`5-7.5s`、`7.5-10s`、`10-12.5s`、`12.5-15s` 六个推进点;每个推进点必须写实际剧情动作,不得用空镜填时长。帧级换算为 `0-60`、`60-120`、`120-180`、`180-240`、`240-300`、`300-360` 帧。 - **时间语义**:15秒是实际生成时长;“30秒剧情量”表示信息密度和事件推进量,不得把台词或动作标成超过该推进点实际可执行时长。长台词按自然停顿压缩或拆分,原文不得改写。 - **直投喂格式**:用户要“完整提示词”时,把必要约束直接融合进每个动作段,不另起“剧本分析、台词锁定、精准时间测算、规划结论”四个模板段。最终提示词正文禁止出现秒数、时间戳、帧号或带时间的区间标签。每个动作段必须融合:景别/焦段/景深、镜头运动、空间调度、角色锚点、光影变化、动作起因-过程-结果、对白与音画同步。 - **画面文字**:涉及屏幕、纸张、刻字、数字、日期、招牌、证件或地图时,在同一提示词中列出唯一允许出现的准确文字;未列出的画面文字明确禁止,避免伪字。 - **明星感与真实质感**:男女主必须有“明星感、辨识度、真实皮肤质感”,但禁止只写“明星脸、神颜、高级感”等空泛形容词。必须把效果翻译成可拍的外貌锚点:脸型与骨相(如下颌线、颧骨、鼻梁比例)、眼眉与嘴唇特征、发型/发际线、至少一个稳定识别标记(痣、疤、耳饰、发束、瞳色或笑纹),以及原生皮肤细节(毛孔、细纹、胡茬、唇纹、油光/泪光、肤色不均、妆面与皮肤交界)。这些细节要在角色锚点和多个时间戳中重复,并写明特写时的真实光线反射;不得用过度磨皮、塑料皮肤、千人一面或随机换脸替代。 - **参考职责分离**:有 `@图片/@视频` 时,明确每个参考只负责什么:角色参考负责脸、发型、年龄感与服装身份;场景参考负责空间布局、地标、光线方向与色彩;道具参考负责形状、材质与状态;首帧/上一段尾帧负责当前构图、主体位置与动作起始状态。禁止用互相矛盾或无关的参考叠加控制。 - **镜头关系**:每个动作段除景别、焦段、景深和运镜外,补充前景/中景/背景层次、主体视线方向和镜头的叙事目的;“电影感”“高级运镜”不能替代具体机位与空间关系。 - **动机光**:光影变化必须写清光源、方向、照射对象、明暗对比、阴影保留、补光/眼神光、色温和情绪功能;不能只写“高级光影”“氛围光”。 - **分层动作**:每个主要动作按“身体路径与重心 -> 头发/衣料/配饰/道具的二次反应 -> 眼神/眨眼/呼吸/手指/下颌微反应 -> 环境或光线响应 -> 声音提示”组织;每个动作段只保留一个主动作,避免动作堆叠不可读。 ### 表演与情绪可视化硬门 情绪不是单独贴上的形容词,而是角色在目标受阻时采取策略留下的身体证据。每个动作段都必须先明确角色当下想从谁那里得到什么、谁阻止了他、他采取什么策略,以及策略失败或成功后的可见变化;禁止只写“紧张、悲伤、愤怒、害怕、克制、温柔、好看”。 每个出镜角色的情绪必须至少落到两类可见证据: - **眼部动态**:视线先于头部转向目标;关注时有微小眼跳和短暂锁定;压力升高时眨眼变快或突然减少;评估信息时先移开视线再回来;眼神光保持湿润、活着,禁止死鱼眼和冻结凝视。 - **面部微反应**:下颌是否收紧、嘴唇是否抿住或松开、吞咽、鼻翼、眉间细微收缩、笑意是否只到嘴角没有到眼睛;禁止连续挑眉、鬼脸、流泪按钮和夸张表情。 - **呼吸与声音前状态**:吸气位置、呼气是否断开、说话前是否吞咽或停顿;身体刚受力、奔跑或惊吓后不能用平稳无变化的呼吸说话。 - **手部与重心**:手上正在做的事、动作何时被打断;重心前压表示逼近目标,后撤表示防守或评估,低重心表示保护或恐惧;身体动作可以和嘴上台词形成真实矛盾。 - **关系距离与策略变化**:拉近、挡住、回避、停在门槛、把物件压住或收回都必须有关系动机;每次新信息到达后,至少改变一个视线、姿势、速度、距离或手上动作。 动作段按“触发信息 → 身体先反应 → 策略动作 → 结果后的残留状态”组织;台词已被用户要求单独放入独立台词段,因此动作段只写画面中的情绪行为和结果,不写台词原文,不用“说着/问着/喊着”承载情绪。人物要同时保留人设面具和真实裂缝:林晚用收拾、挡住、压低声音掩饰心虚和保护欲;陈柚用追问、压住物件、快速看人又移开视线掩饰害怕;陈致远用少动作、慢节奏、稳定占位制造控制,只有被意外打破时出现极短的眼神或下颌变化。 - **对白表演**:台词原文和口型同步放入独立台词字段,写明角色、动作触发后的说话时机、年龄感、音色、语速、换气、停顿、重音、音量和句尾状态;台词字段不能代替动作段的情绪行为。 - **固定音色(无参考音频时的硬约束)**:每个生成段都必须逐字重复每位说话角色的声音锚点,至少包含性别/年龄感、音域、音色质地、共鸣位置、气声比例、语速、音量、吐字清晰度和句尾习惯;同一角色跨段不得改变为另一种音域、声线、口音、播音腔或夸张哭喊。提示词必须写“沿用该角色固定音色,整段保持一致,禁止临时变声”,并为每句台词写“原句完整说完、口型逐字同步、不得省略或改写”。没有音频参考时,文本锚点只能提高稳定性,不能宣称达到录音级完全一致。 - **对白与动作绑定**:对白不能独立悬空。每句台词必须绑定一个可见动作、视线变化或道具结果;连续对白之间必须发生走位、递交、阻挡、转身、拿取、跌落或明显表情反应。禁止用长时间站立、凝视、慢慢呼吸或无变化空镜填充主体段落。 - **道具状态与可读性**:故事关键道具要标注当前状态、可见状态标记、禁止状态和允许发生状态变化的动作节点;动作顺序必须能读清“准备/触发 -> 执行 -> 结果 -> 反应”,不可把结果写成无因突然出现。 新A与新B都仍然只输出视频提示词,不生成角色图、场景图、道具图或其他资产库内容。 ### Step 3: 精准时间测算(核心步骤) 逐项测算、逐项展示、不跳步骤。 #### 3.1 台词时间 | 台词类型 | 语速标准 | 公式 | |---|---|---| | 普通中文对白 | 3-4 字/秒 | 字数 / 3.5 = 秒数(取中值) | | 情绪台词(哭腔/怒斥/颤抖/压抑) | 2-3 字/秒 | 字数 / 2.5 = 秒数 | | 古风台词/文言/诗词 | 2-3 字/秒 | 字数 / 2.5 = 秒数 | | 气声/耳语/低语 | 1.5-2 字/秒 | 字数 / 1.8 = 秒数 | | 外语对白(英/日/韩等) | 按音节估,约 2.5-3 词/秒 | 词数 / 2.8 = 秒数 | | 停顿/迟疑/换气 | - | 每次 0.5-1 秒 | 一句台词如果过长 -> 按自然停顿拆成多个连续动作段,但原文不改。 #### 3.2 动作时间 | 动作类型 | 最短可看清时间 | |---|---| | 简单表情反应(抬眉/抿嘴/眨眼) | 0.5-1 秒 | | 关键眼神/对视 | 1-2 秒 | | 转头/回身 | 1-2 秒 | | 起身/坐下/蹲下 | 1.5-3 秒 | | 走位(一步) | 0.5 秒/步 | | 走位(从A点到B点,3-5步) | 2-4 秒 | | 拔剑/推门/掀帘/摔杯 | 1-2 秒 | | 单手交手一击 | 1-2 秒 | | 连续交手(2-3个回合) | 3-5 秒 | | 复杂长尾动作(后空翻+拔剑+落地连招) | 4-8 秒 | | 物品拿起/递交/特写 | 1-2 秒 | | 身体倒地/坠落 | 1.5-3 秒 | #### 3.3 运镜与衔接时间 | 运镜类型 | 时间 | |---|---| | 定场/环境建立 | 1-2 秒 | | 推/拉镜头 | 1-3 秒 | | 摇/移镜头 | 1-2 秒 | | 跟拍 | 与主体动作同步 | | 硬切 | 0-0.5 秒 | | 淡入/淡出/叠化 | 1-2 秒 | | 首帧承接(建立空间方位) | 1-2 秒 | | 末帧钩子停留 | 1-2 秒 | #### 3.4 帧级换算(可选) 2.5 支持帧级时间戳。需要卡音乐点/精确到帧时使用:**帧号 = 秒 x 24(24fps)**。 内部可使用帧号或时间单位做长度校验,但这些内部标记不得写入最终提示词正文。 #### 3.5 时间测算表(必须输出) ```text ┌─────────────────────────────────────┐ │ 本段演出时长测算 │ ├────────────────┬────────┬───────────┤ │ 项目 │ 详情 │ 测算时间 │ ├────────────────┼────────┼───────────┤ │ 台词口播 │ ... │ X.X 秒 │ │ 表情与表演 │ ... │ X.X 秒 │ │ 身体动作/走位 │ ... │ X.X 秒 │ │ 道具交互 │ ... │ X.X 秒 │ │ 运镜与转场 │ ... │ X.X 秒 │ │ 首帧承接 │ ... │ X.X 秒 │ │ 末帧钩子停留 │ ... │ X.X 秒 │ ├────────────────┼────────┼───────────┤ │ 测算总时长 │ │ XX.X 秒 │ │ 规划时长 │ │ XX 秒 │ │ 结论 │ 通过/需调整 │ │ └────────────────┴────────┴───────────┘ ``` **测算总时长 > 规划时长** -> 调整优先级: 1. 先延长到 30 秒上限(2.5 单次可达 30 秒) 2. 仍不够 -> 建议拆成“首段 + 延长段”(套娃延长,总长 <=60 秒)或超长视频模式 3. 减少次要动作/反应镜头 4. 删减原创建议台词 5. 用户原文台词按自然停顿拆分到下一个动作段/下一段 6. 用户原文台词绝不删改 **测算总时长 < 规划时长** -> 不要注水: - 不硬凑 30 秒。4-30 秒内任何值都可以。 - 空余时间留给画面自然节奏,不是塞废话。 ### Step 4: 丰富完善成可执行的画面 把抽象内容转为摄影机可拍的物理画面(2.5 物理质感与长尾动作能力强,动作链可以写得更细): - "她很悲伤" -> "眼眶泛红,一滴泪沿脸颊滑落,嘴唇微颤,原生皮肤质感,毛孔清晰可见" - "两人对峙" -> "男左女右,相距三步,风卷落叶从两人之间掠过" - "剑光一闪" -> "剑刃从左下方斜向上挥出,刃面反光划过画面中央,雨水顺着剑刃滑落" 动作动词,具象物理细节,摄影机可见。 #### Step 4.1: 三重身份前置(刺猬星球方法) 提示词正文**先写身份再写动作**。三类身份必须先于动作出现,让动作成立的世界先被定义清楚: 1. **场景身份**:这是一场什么事件(审讯、婚宴、街头偶遇、商品拍摄、走秀、对峙、告别)。回答"这场戏的类型是什么"。 2. **环境身份**:什么时代、地点、空间、行业、阶层、故事背景。回答"动作发生在什么世界里"。 3. **人物身份**:是谁、处于什么心理/身体/任务状态。回答"动作由谁执行、他带着什么状态进入动作"。 写法:把三重身份放在全局约束之后、动作段之前,作为一个独立段落。纯文字版用文字写全;多模态版可由 `@图片` 辅助锁定人物身份和环境身份,但场景身份仍须用文字声明。 示例: ``` 场景身份:一场旧城婚宴厅里的公开指认与栽赃。 环境身份:二〇〇四年中国旧城区,暖黄钨丝灯与旧木楼梯,无智能手机,无社交平台。 人物身份:林晚(34 岁,刚决定不再认罪的母亲,红裙袖口沾酒渍,克制而防备);陈致远(28 岁,正用稳住现场的姿态替所有人定义林晚的父亲,白衬衫干净袖口);苏念(26 岁,被父亲叙事塑造成白月光的证人,额角浅擦伤,手持白山茶胸花);陈柚(20 岁,害怕自己消失的女儿,手背有纸页划痕,紧握童年合影)。 ``` 反着写原则:不先写"某人做某动作",先写"让动作成立的世界"。当世界被定义清楚后,动作会更符合场景逻辑,模型也不易用默认动作填充。 #### Step 4.2: 视觉语言翻译(刺猬星球方法) 禁止用抽象形容词替代可见证据。每个抽象词必须翻译成摄影机可见的物理细节。 翻译规则表: | 抽象词 | 必须翻译成的可见证据 | |---|---| | 真实 | 不完美皮肤、环境磨损、自然阴影、非对称细节 | | 高级 | 克制色彩、少量材质对比、留白、稳定构图 | | 电影感 | 明确光源、景深、镜头运动、空间层次、情绪节奏 | | 活人感 | 微表情、重心偏移、手部自然占用、眼神方向 | | 产品质感 | 材质反光、边缘高光、使用痕迹、尺度参照 | 检查标准:如果删掉一个形容词后画面没有任何变化,它大概率是无效词,必须替换为可见证据或删除。 误解机制与反向控制: - 缺省词会被模型误解成默认效果 -> 反向写:先想模型会怎样默认补齐,再写出反默认的限制。 - 抽象词会被误解成夸张效果 -> 具体写:把抽象词换成可见细节。 - 不确定描述会被自动补齐 -> 明确写:减少"可能、大概、某种、高级感"这类漂移词。 示例: - 不稳写法:"一个高级的未来房间,科技感,氛围好" - 稳定写法:"一个低饱和银灰色的私人实验室,墙面是磨砂金属和半透明玻璃,只有桌面下方的蓝白色线性灯带提供冷光,空间干净但有真实使用痕迹,没有夸张霓虹和赛博城市背景" #### Step 4.3: 镜头语言增强(storyboard-director 方法) 每个动作段的镜头设计必须经过导演决策栈,而非从运动标签出发。 **决策栈(按顺序回答,写入内部校验,不全部输出到提示词正文)**: 1. `narrative_purpose`:这段动作在故事中必须完成什么。 2. `audience_focus`:观众必须首先注意到什么。 3. `blocking_plan`:每个关键主体的起点、谁先动、谁保持主体位、镜头跟还是等。 4. `composition_goal`:画面层级——谁拥有画面中心或主导权重。 5. `focus_shift`:注意力是否转移,从谁到谁,为什么。 6. `movement_motivation`:镜头为什么动或为什么不动。 7. `action_timing_validation`:可用时长能否清楚承载准备、执行、结果、反应。 8. `tempo`:节奏感——克制、悬停、决断、加速、漂浮。 9. `transition_reason`:为什么切到下一段。 **景别选择规则**: - 景别写在动作段开头,作为前标签,最多 1-2 个标签,通常景别在前。 - 必须回答"为什么是这个景别而不是更广或更近一档"。 - 景别须与关键道具状态可见性匹配:需要显示道具状态标记时,景别必须足够近。 - 运镜写在句体中,不堆叠在标签里。禁止 `[近景][平视][广角视感][慢推→横移→跟拍]` 这种长运动链标签。 **镜头运动动机规则**: 镜头运动仅在服务以下目的时使用,否则保持静止: - 承诺(人物做出决定时推进) - 犹豫(人物迟疑时微停或后拉) - 追逐(跟随移动主体) - 揭示(运动后揭露新信息) - 隐藏(运动遮挡某物) - 空间澄清(运动建立空间关系) - 情感接近(缓慢推近情感核心) - 情感退缩(缓慢后拉离开情感核心) 禁止装饰性运动:节拍关于静止时、走位已通过 blocking 清晰时、运动损害身份一致性时。 ### 镜头运动可执行硬门 每个动作段必须在动作段正文中明确写出“镜头状态”,不能只写“电影感”“跟拍”“动态镜头”或只给一个运镜动词。镜头状态只允许从“静态镜头”或“动态镜头”开始,并继续写清以下可执行信息: - **起始机位**:镜头相对主体位于前方、后方、左前方、右前方、侧后方、门内侧、门外侧、桌边或人物肩后;不使用无法复现的绝对坐标。 - **主体相对位置**:明确谁在镜头前景、谁在主体近侧、谁在斜后方、道具位于两人之间还是位于主体手边;人物移动时保持左/右、前/后、内/外侧关系不漂移。 - **运动路径**:动态镜头必须写“从哪里出发 -> 沿谁的哪一侧/哪条通道移动 -> 跟随谁或等待谁 -> 在什么结果出现时停下”;例如“镜头从门内侧、位于陈致远肩后开始,先静待门口的苏晚棠进入视线,再沿餐桌东侧通道平行跟随拖箱者前进,直到箱轮碰到桌脚停住”。 - **静态镜头边界**:静态镜头必须写明“镜头固定不移”,以及静止的叙事原因;允许人物在画面内移动,但镜头不跟随、不绕行、不无理由推拉。 - **动态镜头边界**:动态镜头必须写明运动目的(空间澄清、揭示、追逐、承诺、犹豫、隐藏、情感接近或情感退缩),禁止同一动作段堆叠推、拉、摇、移、环绕、跟拍等无因运动。 - **收束状态**:每个动态镜头必须写清停止点和停下后的终帧关系;每个静态镜头必须写清最终主体相对位置和道具状态。 镜头运动写入动作段的句体,顺序优先采用“镜头状态 -> 起始相对机位 -> 主体先后动作 -> 镜头路径/等待 -> 停止点 -> 终帧构图”。不要把“动态/静态、机位、路径、速度、运动链”堆成段首标签。镜头运动必须服从 blocking:先决定人物怎么走,再决定镜头是否跟;镜头不能替人物完成空间关系,也不能用运动掩盖动作因果。 **构图规则**: - 每个动作段写明 `composition_goal`:谁拥有画面中心或主导权重。 - 画面层级必须有意、可读、非随机:写清前景/中景/背景层次。 - 主角层级:主角靠近画面中心或更强对比,配角从边缘或次平面进入。镜头跟随主角决定而非配角入场。 - 视觉中心转移必须有意且可读,不能随机漂移。 - 表情变化强度必须大于镜头运动强度——镜头不应抢戏。 **主角画面权重规则**: - 被剧本指定为当前节拍主角的角色,保持画面中心或更强对比。 - 配角从画面边缘、次平面或侧方权重进入。 - 镜头跟随主角的决定,而非配角的入场。 - 仅在故事重心真正转移时才交接视觉优先级。 #### Step 4.4: 光影设计增强(storyboard-director 方法) 光影是叙事结构,不是装饰。提示词中的光影必须翻译为可见结果,不写片场技术参数。 **光影决策优先级(按顺序)**: 1. 观众应感受到什么情绪 2. 观众必须看清什么 3. 光源的世界内动机 4. 场景能容忍多少对比度 5. 材质对光应该怎样响应 不先命名灯具或写泛用"cinematic lighting"。 **情感光影策略(五选一或组合)**: | 情感 | 光影策略 | 可见效果 | |---|---|---| | 舒适/治愈 | 柔和主光+低对比补光+暖色偏移 | 稳定曝光、无硬 clipping、温柔分离光 | | 脆弱/温柔 | 柔但有方向的主光+一侧负补光+稍暗背景 | 受控高光、情感近景可读 | | 奇幻/惊奇 | 动机光源基础+一层风格化点缀+可见轮廓光 | 选择性粒子/雾气发光、受控 bloom | | 紧张/威胁 | 强主补光对比+窄束或更方向性光源+冷色或混合色温 | 减少背景提亮、阴影中无逃生空间 | | 喜悦/释放 | 更高曝光+更广补光+清晰眼神光+干净主体背景分离 | 可读色彩对比、清晰品牌色 | **光比映射情感(提示词中不写数值,翻译为可见效果)**: | 光比范围 | 情感 | 可见效果写法 | |---|---|---| | 1:1-2:1 | 开放、柔和、友好 | "极柔低对比光,面部均匀受光" | | 2:1-4:1 | 自然、电影感、平衡戏剧 | "适中对比,暗部保留可读细节" | | 4:1-8:1 | 强戏剧、悬疑、压迫 | "深阴影侧,极少补光" | | 8:1+ | 风格化紧张或孤立 | "极强反差,暗部接近纯黑" | **色温作为关系而非单一值**: - 暖主光+冷背景 -> 亲密主体、开阔世界 - 冷环境+暖实用光 -> 夜景情绪焦点 - 中性日光+暖反射 -> 诚实自然主义 - 暖夕阳+柔中性补 -> 高端生活方式暖意 禁止写精确 K 值,用可见措辞替代:"暖金主光"、"冷蓝环境阴影"、"中性日光基础加暖色实用光点缀"。 **动机光源**: 每盏重要光必须有世界内动机。典型动机:太阳、阴天、窗户、灯笼、蜡烛、月光、实用灯泡、魔法物、反射地面或墙面。奇幻规则:从可信基础光源出发,再加一层风格化点缀。禁止无叙事原因的各方向随机发光。 **材质光影行为**: | 材质 | 偏好光法 | 禁止光法 | |---|---|---| | 棉/毛/织物 | 柔主光+逆光边缘 | 过多硬正面光(显扁平灰蒙) | | 皮肤 | 柔方向光+受控补光+眼神光 | 硬光直射无补光 | | 玻璃/釉面 | 受控反射+干净高光形状 | 杂乱随机反射 | | 金属/光泽 | 少而有意的高光形状 | 过多竞争高光 | | 烟雾/尘/粒子 | 必须逆光/侧光/体积光 | 纯正面光(杀死深度) | **提示词转译规则**: 光影策略必须翻译为可见结果,不写片场指令。 - 好:"暖色夕阳逆光穿过棉布纤维"、"柔方向主光带温和阴影侧"、"月光轮廓光洒在蓬松边缘" - 差:"主光 45 度相机左侧 4:1 光比 5600K" ### Step 5: 输出 Seedance 2.5 双版本提示词 每个生成段输出两个版本:多模态版(有 `@` 素材时)+ 纯文字版(无素材可直接用)。 ## 输出格式 ```markdown ## 剧本分析 - 出场角色: [CH01 角色名] [CH02 角色名] - 场景: [SC01 场景名称] - 生成模式: [单段生成 / 视频延长 / 超长视频模式] - 核心动作: [一句话概括] - 情绪走向: [起点情绪 -> 终点情绪] - 台词锁定: | D01 | [角色名] | "[台词原文]" | [字数]字 | [语速类型] | ## 内部长度校验 [只在内部校验台词、动作、走位、道具、运镜和承接是否可执行;不把秒数、时间戳或帧号写入交付正文。] --- ### Seedance 2.5 多模态版提示词 > 【全局约束声明】 > 1. 视觉风格:[风格描述],全片禁止风格偏移。 > 2. 字幕与音频:[如"全片无字幕、无背景音乐,纯净视频"或"台词仅发声无字幕,BGM 使用@音频1"] > 3. 参考素材:@图片1=[角色锚点],@视频1=[参考运镜轨迹/动作节奏],@音频1=[BGM](无素材则省略本项) > > 【三重身份】 > 场景身份:这是一场[事件类型]。 > 环境身份:发生在[时代/地点/空间/行业/故事背景]。 > 人物身份:[人物是谁],此刻处于[心理/身体/任务状态]。 > > 动作段一:[景别前标签] [起始状态、触发、准备、执行、结果、细微反应;运镜写在句体;构图目标:谁拥有画面中心;光影:光源动机+可见效果+情感映射;台词与声音。] > 动作段二:[按实际先后继续描述下一个动作或镜头变化。] > 动作段三:[继续描述动作结果、角色反应、道具状态和镜头收束。] > > 负向约束:禁止出现[字幕/水印/无关BGM/IP元素等,按需声明]。 --- ### Seedance 2.5 纯文字版提示词 [保留相同动作顺序和镜头逻辑,把 @引用替换为完整文字描述;三重身份用文字写全;最终正文禁止出现秒数、时间戳、帧号或时间区间。] ``` ### 延长段专用格式 用户要接续已有成片时: ```text 接续上一段结尾:[一句话复述上一段末帧状态,确保无缝承接]。延长 X 秒。 0-Xs(延长段内时间轴):[新动作/新场景变化描述] [保持角色锚点重复;声明“画面风格、人物、场景与上一段保持一致”] ``` ### 超长视频模式格式 适用于 <=180 秒: ```text 【全局约束声明】(同上) 镜头 1(0:00-0:08)运镜:[运镜]。画面:[画面描述]。台词:[角色]:“[原文]”。音效:[音效/BGM]。 镜头 2(0:08-0:15)运镜:...。画面:...。台词:...。音效:...。 [按时间顺序排列所有镜头,镜头时间区间连续不重叠,总长 <=180 秒] ``` ## 核心规则 ### 时间规则 - 单段 4-30 秒,不强制满 30 秒。能 6 秒完成的不用 8 秒,能 15 秒完成的不用 20 秒。 - 每个镜头不少于 1 秒(特写/反应),不超过 10 秒。 - 30 秒内最多 8 个镜头;15 秒内最多 5 个镜头。 - **30秒节奏下限(项目短剧硬约束)**:30秒生产段不得只完成“定场+一句台词+一个反应”。除非是明确的钩子特写段,否则至少包含两个可辨认的剧情动作链、至少两轮对白或对白与关键声音事件的交替,并发生一次角色目的/空间位置/关键道具状态的变化;对白总量以能自然说完且留出动作反应为准,优先保证事件推进,不靠慢推、凝视和空镜拖时长。 - **节奏复核**:内部测算时把对白、动作、反应和镜头衔接逐项相加;若动作密度不足或对白只剩一句,必须回到剧本重排事件,不得用“克制”“留白”“电影感”掩盖节奏空洞。 - 必须展示完整测算过程,不能只给结论。 - 动作段必须按实际先后排列,前后状态能够连续承接。 - 关键眼神、情绪停顿、动作余韵该留就留——精简但不破坏节奏。 - 帧级标注仅在有卡点需求时使用:帧号 = 秒 x 24。 ### 台词规则 - 用户剧本中的台词逐字锁定。不得翻译、改写、润色、删减、合并。多语种台词保留原语言。 - 台词在时间测算表和提示词中完全一致。 - 用户没给台词时可生成“原创建议台词”并标注;需要口型同步时声明“嘴型与台词发音严格同步”。 ### 画面规则 - 只写摄影机可拍到的——动作、表情、物体、光线。禁止抽象“意境”“高级感”,转成具体光线、颜色、动作、构图。 - 动作描写用「起点状态 -> 过程 -> 终点状态」完整链条。2.5 长尾动作能力强,复杂连招可以完整写出(如“后空翻落地后迅速拔剑,雨水顺剑刃滑落”)。 - 材质写具体名 + 颜色 + 质感;追求真实感时用“原生皮肤质感”“毛发根根分明”等 2.5 敏感词。 - 多镜头/多区间中角色必须重复面部、发型、服装锚点,保证切镜一致性。 - 男女主的“明星感”必须来自稳定、可识别、可复现的外貌组合,而不是名人姓名或泛化审美词;每个角色至少写出脸型/骨相、三项五官特征、一个识别标记和两项皮肤/毛发真实细节。近景要写毛孔、唇纹、细小表情纹、汗/泪/油光如何被当前光线照出。 - 对峙或恋爱对话不能让人物原地站立:写清初始站位、触发事件、距离变化、视线/遮挡、主角动作、对方反应,以及谁改变了谁的路线或目标。 - 空镜/插入镜头必须承担时间、地点、关系、情绪或转场信息;用“主体当前状态 + 一个动态细节 + 有动机的光线 + 简单运镜”写实物,不用无意义空镜填时长。 - 关键道具或身体状态发生变化时,必须在时间轴中显式写出变化前状态、触发动作、变化后状态和角色反应,保持前后区间可验证。 ### 2.5 专属规则 - 最终提示词不使用时间标签;使用“动作段一、动作段二、动作段三”等顺序标题,或直接用连续自然段表达动作推进。 - **单段交付结构**:每个生成文件默认是一条连续叙事,按动作段一、动作段二、动作段三等顺序推进;不要把真人参考声明或“只做一段”说明复制到提示词末尾。Dola渠道仍保留第一行固定句 `严格参考:seedance2.5 模型。只生成一段。共消耗 2 个视频额度。`,但不再生成 `## 最后执行约束`。 - **多段交付每段完全独立自包含(强约束)**:当交付多段时(如用户要求多个片段),每个段必须是**完全独立自包含的提示词**——各自内嵌完整的角色锚点、道具锚点、场景锚点、三重身份、全局约束、动作段与负向约束。**禁止使用"共用锚点段+各段引用"的总分结构**。用户复制任何一段出去都应能直接使用,无需拼接或补充上下文。不得合并为一个合集文件内含所有段,也不得让段依赖另一段的内容(除 `@img/@视频` 参考绑定外)。每段头部标注生成模式(文生/图生)及参考绑定关系。 - **交付正文严禁任何时长/时长目标字样**:提示词正文、交付说明、注释、头注里一律不得出现“单次生成 30s”“以 30s 为单元”“共 N 段各 30s”“原 75s 重组”等任何把“单次生成时长”或“分段”写出来的字样——这类表述会被模型误解为“要拆成多段/带时长”。时长与分段只存在于 `内部长度校验` 的导演规划里,绝不下行到交付内容。 - **末尾局部硬约束**:所有正式提示词末尾使用 `## 局部硬约束`,只写当前段的画面负向约束和连续性锁定,必须明确禁止字幕、自动字幕、说明字幕、内嵌文字、水印、logo、品牌标识和未授权可读文字;不要加入真人参考图声明,不要加入“只做一段,整段一次生成……”整段话。 - 交付结构默认即一段;需要在交付头部说明组织方式时,只写逻辑先后(如“首段文生 / 后续图生接续”);不要在提示词末尾重复单段说明,也不得写各自时长或“生成两段”。 - `@图片/@视频/@音频/@音效` 引用必须声明用途(参考什么、不参考什么),例:“@视频1仅参考运镜轨迹与动作节奏,不保留原画面质感”。 - 需要干净底片时显式写“纯净视频,全程无字幕、无背景音乐”;需要指定字幕/文字语言时显式声明“画面所有文字必须为[语言],禁止出现其他语言文字”。 - 需要去除参考素材 BGM 时写“去除@视频1中的背景音乐,仅保留人声”。 - 负向约束放心写:禁止字幕/水印/logo/IP 角色/品牌元素,2.5 响应可靠。 - 不生成资产库提示词(角色图/场景图/道具图/三视图)。 - 白模任务使用 2.5 白模公式——粗颗粒:【参考声明】+【对应关系映射】+【剧情详述】+【场景处理】+【整体收束】;细颗粒:【渲染指令】+【分段渲染描述】+【场景处理】+【整体收束】。 ## 时长选择参考 | 剧本特征 | 建议时长 | 理由 | |---|---|---| | 一个眼神/一个反应/一个动作 | 4-6 秒 | 短镜,不拖 | | 一句台词 + 一个动作 | 6-8 秒 | 刚好说完做完 | | 两句台词交替 + 反应 | 8-12 秒 | 对话节奏 | | 三句台词 + 走位 + 动作 | 12-15 秒 | 编排紧凑 | | 追逐/打斗/多人交互/复杂连招 | 15-30 秒 | 2.5 支持 30 秒单次,动作密度高不必硬切 | | 古风台词(慢速)+ 情绪 | 比现代语速 +2-3 秒 | 古风语速 2-3 字/秒 | | 完整短片/MV/预告(多镜头叙事) | 超长视频模式 <=180 秒 | 一次性直出,长时序一致性好 | | 已有成片想继续演 | 延长段 <=30 秒/次,总长 <=60 秒 | 套娃延长,分段导演控制 | ## 质量自检 输出前必须确认: **基础检查** - [ ] 是否只输出视频提示词,没有角色/场景/道具资产库内容? - [ ] 是否只在内部完成长度校验,且最终提示词正文没有秒数、时间戳、帧号或时间区间? - [ ] 测算总时长是否 <= 规划时长? - [ ] 台词是否逐字锁定、不被修改?多语种台词是否保留原语言? - [ ] 是否从 4-30 秒中选择具体时长,而非默认拉满? - [ ] 动作段是否按实际先后排列,前后状态能够连续承接? - [ ] 是否给出了多模态版 + 纯文字版,且两版都不含时间标签? - [ ] `@` 素材引用是否声明了"参考什么、不参考什么"? - [ ] 需要纯净素材/指定文字语言/去除 BGM 时,是否写了显式声明? **身份与视觉语言检查(刺猬星球方法)** - [ ] 提示词是否在动作段之前写了三重身份(场景身份、环境身份、人物身份)? - [ ] 是否有抽象形容词(高级感/电影感/真实/氛围好)未被翻译成可见证据? - [ ] 是否预判了模型误解——对容易触发默认补齐的词写了反默认限制? **镜头语言检查(storyboard-director 方法)** - [ ] 每个动作段是否写明了景别,且景别选择有叙事动机(不是随机选的)? - [ ] 是否回答了"为什么是这个景别而不是更广或更近一档"? - [ ] 镜头运动是否有叙事动机(承诺/犹豫/追逐/揭示/隐藏/空间澄清/情感接近/退缩),而非装饰性运动? - [ ] 每个动作段是否写明了构图目标(谁拥有画面中心或主导权重)? - [ ] 画面层级是否写清了前景/中景/背景,而非随机堆叠? - [ ] 主角画面权重是否正确——主角在画面中心或更强对比,配角从边缘进入? - [ ] 表情变化强度是否大于镜头运动强度(镜头不抢戏)? - [ ] 运镜是否写在句体中,而非堆叠在标签里? - [ ] 每个动作段是否明确写出“静态镜头”或“动态镜头”? - [ ] 动态镜头是否写清起始相对机位、主体相对位置、运动路径、跟随/等待对象、停止点和终帧构图? - [ ] 静态镜头是否写明镜头固定不移及其叙事原因,并保持人物移动后的相对位置和道具状态可读? - [ ] 镜头运动是否服从人物 blocking,而不是用运动标签替代空间调度? **光影设计检查(storyboard-director 方法)** - [ ] 光影是否翻译为可见结果,而非片场技术参数(无 K 值、无度数、无光比数值)? - [ ] 是否写明了光源的世界内动机(太阳/窗户/灯笼/月光等),而非泛用"电影光"? - [ ] 光影策略是否匹配当前情感(舒适/脆弱/奇幻/紧张/喜悦)? - [ ] 色温是否作为冷暖关系来写,而非单一数值? - [ ] 材质光影行为是否匹配(织物/皮肤/玻璃/金属/粒子各有偏好光法)? - [ ] 光影是否服务于叙事(观众应感受到什么情绪 -> 必须看清什么 -> 光源动机),而非装饰? **表演与道具检查** - [ ] 画面描述是否摄影机可见(动作动词 + 物理细节),跨区间角色锚点是否重复? - [ ] 男女主是否具备可复现的明星感与辨识度(具体脸型、五官、识别标记),并写出真实皮肤/毛发纹理及光线反射,而非只写"明星脸/高级感"? - [ ] 每个 `@` 参考是否有唯一职责,且没有互相矛盾或无关参考? - [ ] 主要动作是否具备准备/触发、执行、结果、反应四步,并包含衣料/头发/道具的二次物理反应? - [ ] 每个出镜角色是否有明确的当下目标、阻力、策略和失败/成功后的残留状态? - [ ] 动作段是否写出眼部动态、面部微反应、呼吸、手上动作、重心或关系距离中的至少两类可见情绪证据? - [ ] 情绪是否由触发和策略产生,而不是只写“紧张、悲伤、愤怒、克制、温柔、好看”等抽象标签? - [ ] 是否有反应在搭档台词结束前开始、思考先于台词、手上动作被打断作为重音的表演证据? - [ ] 对白是否独立放在台词字段,并写明说话时机、音色、语速、音量、换气、停顿、重音和句尾状态? - [ ] 是否逐段重复固定音色锚点,并声明无参考音频时禁止临时变声、口音和音域漂移? - [ ] 30秒段是否至少有两个剧情动作链、两轮对白或声音事件交替,以及一次目标/位置/道具状态变化? - [ ] 是否每句对白都绑定了可见动作、视线变化或道具结果,而不是人物原地站立说话? - [ ] 关键道具状态是否有当前状态、可见标记、禁止状态和合法变化时点? - [ ] 是否没有废话填充,每个动作段都有不可替代的叙事价值? ## 增强来源声明 本 skill 的 Step 4.1-4.4 和质量自检增强自以下来源: **刺猬星球提示词方法**(`C:/Users/lsb/Documents/刺猬星球提示词资料库/`): - 方法卡 03《身份前置与反着写》:三重身份(场景身份/环境身份/人物身份)必须先于动作出现。 - 方法卡 02《五块结构法》:情绪+主体+光线+镜头+细节的五块拆分。 - 方法卡 04《视觉语言不是关键词》:抽象词翻译为可见证据。 - 方法卡 05《光线控制》:光线至少写方向、光比、色温三件事。 - 方法卡 06《误解机制与反向控制》:反向写、具体写、明确写。 **storyboard-director**(`ai-video-skill-route-export/storyboard-director/references/`): - `lighting_design.md`:情感光影策略(五种)、光比映射情感(四档)、色温关系(四种模式)、动机光源、材质光影行为、Seedance 可见结果转译。 - `director_decision_framework.md`:导演决策栈(九项有序)、镜头运动动机(八种合法动机)、主角画面权重规则、景别选择追问。 - `storyboard_prompt_format.md`:景别前标签规则(最多 1-2 个、景别在前)、运镜写句体不写标签。 - `evaluation_rubric.md`:构图逻辑评分、镜头动机评分(硬性失败项)。 增强原则:取长补短,不替代 sd2.5skill 原有的 Seedance 2.5 渠道规格、时间测算和 AB 双段模式;仅在 Step 4(丰富完善成可执行的画面)和质量自检中增加约束力。 表演系统来源:`outputs/niannian-ai-video-workflow-bundle-v1/skills/hell-grind/references/acting-system.md`。本项目将其“压力下的行为、目标/阻力/策略/节拍/潜台词、倾听反应、眼部动态、重心与呼吸、手上动作、距离和地位、双重真相”规则编译进每个动作段;不直接把情绪标签当作表演指令。