2025年AI视频提示词工程完整指南
掌握创作令人惊艳的AI生成视频的提示词技巧。学习六层框架、电影术语和平台专属技术。

AI视频的提示词工程就像完善一道菜谱:同样的食材,根据技巧的不同会产生截然不同的结果。在各大主流平台上生成了无数小时的视频后,我们将真正有效的方法提炼成了一个实用的框架。让我们抛开噪音,专注于能够产生一致、专业结果的技术。
为什么视频提示词与众不同
如果您使用过Midjourney或DALL-E等图像生成器,您可能会认为视频提示词的工作方式相同。但事实并非如此。视频增加了时间维度——运动、节奏、过渡——这将提示词工程从单一指令转变为编排一个序列。
可以这样理解:拍摄照片和导演场景之间的区别。对于照片,您需要设置镜头。对于视频,您需要编排随时间展开的内容:
- 摄像机如何移动?
- 展开了什么动作?
- 每个元素持续多长时间?
- 情感弧线是什么?
这些问题需要超越静态图像提示词的词汇和结构。
六层框架
专业的视频提示词遵循结构化的方法。我们称之为六层框架——每一层都增加了特定性,引导AI朝着您的愿景前进:
第1层:主体与动作
精确定义您的焦点。模糊的主体产生模糊的结果。
弱化: "花园里的一个女人" 优化: "一位身穿飘逸红裙的女士缓缓穿过玫瑰丛,轻柔地触碰经过的花瓣"
优化版本指定了服装、移动速度以及与环境的互动。每个细节都将AI的解释约束到您的意图。
第2层:镜头类型与构图
电影摄影师花了一个世纪开发视觉语法。请善用它。
| 镜头类型 | 使用场景 |
|---|---|
| 远景 | 建立位置、规模 |
| 中景 | 角色互动、对话 |
| 特写 | 情感、细节、亲密感 |
| 大特写 | 戏剧性强调 |
示例: "中景跟踪镜头,摄像机位于腰部高度,从侧面跟随"
第3层:摄像机运动
静态镜头显得业余。运动创造能量并引导注意力。
| 运动方式 | 效果 |
|---|---|
| 摇镜(Pan) | 水平展示空间 |
| 倾斜(Tilt) | 垂直展示空间 |
| 推拉/跟踪(Dolly/tracking) | 创造深度,跟随主体 |
| 升降(Crane) | 建立规模、戏剧性 |
| 手持(Handheld) | 紧迫感、纪录片感觉 |
| 斯坦尼康(Steadicam) | 平滑跟随、沉浸感 |
示例: "缓慢推进穿过门口,保持视线水平视角"
第4层:光线与氛围
光线比任何其他元素更能强烈地设定情绪。
| 术语 | 视觉效果 |
|---|---|
| 黄金时刻(Golden hour) | 温暖、浪漫、怀旧 |
| 蓝调时刻(Blue hour) | 冷色调、沉思、神秘 |
| 高调(High key) | 明亮、乐观、干净 |
| 低调(Low key) | 戏剧性、阴郁、悬疑 |
| 体积光(Volumetric light) | 穿过雾/尘埃的光线,空灵 |
| 轮廓光(Rim lighting) | 分离、戏剧性、轮廓边缘 |
示例: "黄金时刻光线,体积光线透过尘土飞扬的窗户过滤,温暖的色彩调校"
第5层:技术规格
当您想要精确控制时,请指定具体的技术参数:
- 镜头: 35mm(自然)、50mm(肖像)、85mm(压缩)、24mm(广角)
- 景深: 浅景深(背景虚化)vs. 深景深(一切清晰)
- 帧率: 24fps(电影感)、60fps(流畅)、120fps(慢动作)
- 宽高比: 16:9(标准)、2.39:1(电影)、9:16(竖屏)
示例: "使用85mm镜头拍摄,浅景深带有奶油般的虚化,轻微的胶片颗粒"
第6层:持续时间与节奏
视频随时间展开。指定节奏:
- 场景时长(通常3-10秒)
- 过渡风格(切换、溶解、擦除)
- 节奏(慢/沉思 vs. 快/充满活力)
- 音乐同步的节拍时机
示例: "6秒镜头,缓慢、从容的移动,最后一帧保持1秒"
综合应用:完整提示词示例
以下是各层如何组合成专业提示词:
电影肖像:
渔夫饱经风霜的面部中特写,清晨蓝调时刻,
使用85mm镜头拍摄,浅景深。轻柔的手持微动,
从后面柔和的轮廓光在他的灰发上创造光晕效果。
沉思的表情,眼睛稍微偏离镜头。
冷色调调校并提升阴影,持续5秒。动作序列:
广角跟踪镜头,跟随一位跑酷运动员在日落时分穿过城市屋顶。
动态斯坦尼康运动保持一致的距离,
黄金时刻逆光创造戏剧性剪影。24fps电影运动,
以0.8倍速度轻微慢动作。高对比度,青橙色调。
8秒钟,强度逐渐增强。产品展示:
缓慢360度环绕黑色天鹅绒表面上的豪华手表。
微距镜头捕捉复杂的表盘细节,受控的工作室照明
带有柔和的主光和微妙的补光。浅景深隔离
主体,水晶上的温柔反射。高级感
缓慢、从容的摄像机移动。持续10秒。负面提示词:告诉AI要避免什么
同样重要的是指定您不想要什么。每个平台处理方式不同:
常见负面提示词:
- 模糊镜头、动态模糊伪影
- 扭曲的面部、解剖错误
- 水印、文字叠加
- 不自然的运动、抖动的过渡
- 低分辨率、压缩伪影
平台专属语法:
| 平台 | 方法 |
|---|---|
| Veo 3 | 专用负面提示词字段 |
| Kling | 在提示词中包含"避免"或"不含" |
| Runway | 单独的负面提示词参数 |
| Sora | 基于权重的排除 |
示例: "避免:模糊镜头、扭曲的面部特征、水印、抖动的摄像机移动、过饱和的颜色"
风格参考堆叠
想要独特的美学?结合2-3个电影参考:
公式: [电影A]色彩调校 + [电影B]氛围 + [电影C]摄像机移动
示例:
- "《银翼杀手2049》色彩调校加上《七宗罪》氛围加上《盗火线》摄像机移动"
- "韦斯·安德森的对称性加上吉卜力工作室的调色板加上泰伦斯·马力克的自然光线"
- "《疯狂的麦克斯:狂暴之路》的能量加上罗杰·狄金斯的光线加上斯皮尔伯格的布景"
限制在3个参考以内。更多会产生冲突的信号。
平台专属优化
每个模型都有优势。将您的提示词风格与平台匹配:
| 模型 | 优势 | 提示词重点 |
|---|---|---|
| Kling 2.5 | 运动动作、角色动画 | 动作动词、身体运动 |
| Sora 2 | 多镜头叙事、空间一致性 | 场景过渡、叙事弧线 |
| Veo 3 | 精确控制、JSON格式 | 技术规格、结构化语法 |
| Runway Gen-3 | 风格化、艺术诠释 | 美学参考、情绪描述词 |
| WAN 2.5 | 对话、唇同步 | 语音动作、面部表情 |
Veo 3 JSON示例:
{
"subject": "穿红裙的女人",
"action": "穿过花园",
"shot_type": "中景跟踪",
"camera_movement": "从右向左推",
"lighting": "黄金时刻,体积光",
"lens": "35mm",
"duration": "6秒"
}5-10-1成本优化规则
高级渲染成本高昂。使用此工作流程:
- 5个变体 在低成本模型上(每个40-60积分)
- 10次迭代 精炼最佳候选
- 1次最终渲染 在高级层级(约350积分)
这将成本从数千降低到大约1,000积分,同时保持质量。
需要避免的常见错误
在审查了数百个提示词后,这些错误最常出现:
| 错误 | 问题 | 修正 |
|---|---|---|
| 随意描述 | AI解释松散 | 使用电影摄影术语 |
| 持续时间不匹配 | 动作不符合时间框架 | 将复杂性与持续时间匹配 |
| 风格过载 | 冲突的美学信号 | 限制最多3个参考 |
| 缺少运动 | 静态、业余感觉 | 始终指定摄像机运动 |
| 模糊的光线 | 不一致的情绪 | 命名具体的光线设置 |
| 没有负面提示词 | 不需要的伪影 | 明确排除问题 |
构建您的提示词库
为常见场景创建模板:
采访设置:
中景,主体位于三分法则左侧,视线水平摄像机,
[光线设置],浅景深模糊背景,
微妙的手持微动以获得自然感觉,[持续时间]。B-Roll自然:
[主体]的[镜头类型],[时间段]光线,
缓慢的[摄像机运动],[镜头]mm镜头,深焦,
[色彩调校]调色板,[持续时间]。产品主角:
[产品]在[表面]上的[轨道方向]环绕,
工作室照明带有[主光位置]主光和微妙的补光,
微距细节时刻,[镜头]mm,完美的反射,[持续时间]。根据具体需求填充括号。按用例组织构建库。
迭代策略
完美的提示词通过系统化的精炼而产生:
- 从简单开始: 仅核心主体和动作
- 添加一个元素: 测试单个添加
- 记录有效内容: 保留有效短语的日志
- A/B测试措辞: 相同概念,不同词语
- 保存成功者: 构建您的提示词库
日志格式:
提示词:[完整提示词]
模型:[使用的平台]
结果:[1-5评分]
备注:[有效/无效的内容]质量审查清单
在最终确定任何AI视频之前,请验证:
- 整个过程中主体一致性
- 自然运动(无抖动)
- 光线连续性
- 无面部扭曲
- 色彩调校一致性
- 适当的节奏
- 干净的音频(如果适用)
- 无水印或伪影
下一步
提示词工程随着实践而提高。从更简单的镜头开始,掌握每一层,然后将它们组合起来。目标不是记住术语——而是培养对什么使视频引人注目的直觉。
保持生成日志。审查有效的内容。构建您的库。业余和专业AI视频之间的差异通常归结于提示词的精确性。
您的摄像机正在等待。开始拍摄吧。
相关文章
继续探索这些相关文章



