🎬 AI视频脚本 · Prompt工程

AI 视频脚本怎么写?
5 要素 Prompt + 镜头术语 + 视频生成衔接

本指南从 Prompt 工程视角回答 AI 视频脚本怎么写这件事。文字脚本只是 AI 创作脚本的第一段,真正的全链路是:5 要素结构 Prompt → 加入镜头与运镜术语 → 输出含分镜的脚本 → 衔接到 AI 视频生成(文生视频 / 图生视频)。每一步都给到具体公式和真实技能调用案例。

📅 2026年5月更新 ⏱ 完整阅读约 13 分钟 🎯 适合:进阶创作者 / AI玩家 / 视频生成尝鲜者
5 要素 Prompt 生成结构化拍摄脚本:含标题、平台、时长、类型、BGM 建议的完整输出
▲ 输入 5 要素 Prompt → 输出 含 HOOK 标注、时间轴、口播、画面的可拍摄脚本

AI 创作脚本,多数人卡在 Prompt 上

写不好 AI 视频脚本,不是 AI 不行,是你给 AI 的指令缺东西。

① 只给主题不给镜头

你说"写一个海边的视频脚本",AI 不知道是远景全景还是人物特写,输出全是文学化描述:温柔的海风、柔和的光线……一句都拍不出来。必须给 AI 镜头语言。

② 把"脚本"和"分镜"混为一谈

很多人让 AI 写完脚本,就直接拿去拍。其实脚本是口播逻辑,分镜是镜头清单,两层信息不能合并。AI 要分两轮做:先输出脚本,再让 AI 把脚本拆成分镜。

③ 不知道脚本和视频生成怎么衔接

如果你想用文生视频 / 图生视频做素材,AI 视频脚本的每段画面描述要按视频生成模型的口味写——景别词、运镜词、光线词缺一不可。否则模型给你的素材完全不像你想要的。

AI 视频脚本怎么写?先把 Prompt 写完整

把这 5 个要素填齐,再丢给 AI——产出立刻不一样。

1

主题 + 平台 + 时长 + 受众 + 情绪

基础结构

5 要素一行一个,写完贴到 AI 工具就能跑。下面是好坏 Prompt 对照:

要素反面(AI 容易跑偏)正面(AI 准确产出)
主题理财三十岁前应该攒下多少钱才不焦虑
平台(缺)视频号
时长短一点90 秒
受众年轻人28-35 岁一线城市白领,月收入 1.5-3 万
情绪(缺)温暖 + 干货,不能说教
📝 完整 Prompt 模板
主题:三十岁前应该攒下多少钱才不焦虑 平台:视频号 时长:90 秒 受众:28-35 岁一线城市白领,月收入 1.5-3 万 情绪:温暖 + 干货,不能说教 请输出: 1. 标题候选 3 个(标注 HOOK 类型) 2. 时间轴脚本(每段:时长 + 口播 + 画面建议) 3. 封面文案 + 配图描述
2

加入镜头术语:让 AI 给你能拍的分镜

分镜结构

第 1 步出来的"画面建议"通常很模糊,第 2 步要让 AI 把画面建议升级成具体分镜。在 Prompt 里追加一句:

📝 分镜升级 Prompt
请把上面的脚本拆成分镜表格,三列: | 时间段 | 画面(景别 + 主体 + 动作 + 运镜) | 口播(≤ 12 字) | 景别只用:特写 / 近景 / 中景 / 全景 运镜只用:固定 / 推拉 / 平移 / 跟拍 / 手持 至少拆 8-10 行。

把"景别"和"运镜"限定为有限词表,AI 就不会再写"温柔的镜头""柔和的运镜"这种没法拍的描述。

分镜表格输出:时间段 / 画面(景别+主体+动作+运镜)/ 口播 三列分镜脚本
三列分镜表:时间段 / 画面(景别+主体+动作+运镜)/ 口播
3

挑模型:不同大模型擅长不同类型脚本

模型选型

同样的 Prompt 喂不同大模型,输出风格差异很明显。EasyClaw 的「短视频脚本创作」技能内置了多模型调度,可以一次输入对比多个版本。下面是常见的偏向:

模型偏向擅长场景适合内容类型
Kimi 系长上下文、信息密度高知识干货、深度评测、行业分析
DeepSeek 系逻辑严谨、推理强科普、技术教程、避坑指南
豆包系(Doubao)本土化语感好、口语化剧情、情感、生活向
Qwen 系结构化输出稳带货、测评、固定模板内容
GLM 系创意度高品牌故事、个人 IP、文案派
实战建议:同一个主题先用结构化能力强的模型(Qwen / DeepSeek)出主稿,再用语感好的模型(豆包 / GLM)改一版口播,融合两者优点。EasyClaw 客户端可以一次切换调用,不用你来回切窗口。
4

衔接视频生成:从文字脚本到 AI 视频素材

视频生成衔接

如果你打算用 AI 生成视频素材(替代部分实拍),AI 视频脚本的每段画面描述要写成视频生成模型能懂的英文 Prompt。结构如下:

📝 视频生成 Prompt 公式
[主体描述], [动作/运动], [场景环境], [镜头类型: extreme close-up / close-up / medium shot / wide shot], [运镜方式: tracking shot / dolly in / pan / handheld / static], [光线: golden hour / soft light / rim light], [色彩: cinematic tone / teal and orange], [特效: slow motion / motion blur / bokeh], [画质: 8K resolution, highly detailed]

EasyClaw 内置「视频生成(video-gen)」技能调用火山引擎 Seedance 模型,支持文生视频和图生视频。你把上面的 Prompt 喂进去,它会按景别 / 运镜 / 光线一一执行,得到的素材一致性远高于直接说"一段海边的视频"。

AI 视频生成结果首帧:用含景别、运镜、光线术语的专业 Prompt 调用 video-gen,输出可控的视频素材
▲ 用专业 Prompt 调用 video-gen,输出可控的视频素材(含景别 / 运镜 / 光线)
5

多平台改版 + 标题:一次产出多平台素材

分发结构

同一份 AI 视频脚本要发抖音 / 快手 / 视频号 / 小红书 / B 站,至少要做 2 件事:

口播节奏微调——抖音前 3 秒抓住,快手缓 2 秒,视频号更生活化;
标题各平台一版——同一主题用各平台的爆款公式重写。

EasyClaw 的「自媒体爆款标题生成器」技能就是为这个场景设计:输入 1 个主题,一次输出小红书/抖音/快手/知乎/B站/微博等多平台标题,每个平台按本平台的爆款规律和字数上限自动调整。

自媒体爆款标题生成器:一个主题一次输出小红书、公众号、抖音、知乎、B站多平台爆款标题
▲ 一个主题 → 6 平台爆款标题,按各平台规律自动调字数与语气

AI 视频脚本必备术语词库

把这些术语写进 Prompt,AI 才知道你想要什么。中英双语对照方便文生视频时直接用英文版。

📐 镜头类型 (Shot Types)

extreme close-up 极特写:产品细节、珠宝纹理
close-up 特写:人物表情、产品质感
medium shot 中景:人物半身、使用场景
wide shot 全景:环境展示、大场面
over-the-shoulder 越肩:对话场景

🎥 运镜方式 (Camera Movement)

tracking shot 跟拍:跟随主体移动
dolly in / dolly out 推拉:推近 / 拉远
pan 平移:横向扫过场景
handheld 手持:纪实感、真实感
static 固定:稳定展示、产品镜头

💡 光线与色彩 (Lighting & Color)

golden hour 黄金时刻:温暖日落感
blue hour 蓝调时刻:冷峻黎明感
rim light 轮廓光:勾勒主体边缘
soft light 柔光:均匀照明、人像
cinematic tone / teal and orange 电影色调:好莱坞风格

✨ 特效与质感 (Effects)

slow motion 慢动作:液体飞溅、瞬间
motion blur 动态模糊:速度感
bokeh 背景光斑:虚化突出主体
depth of field 景深:前景清晰背景虚
film grain 胶片颗粒:复古质感

从文字脚本到 AI 视频,整条链路用 EasyClaw 跑通

「短视频脚本创作」负责文字脚本与分镜,「视频生成」负责 AI 视频素材,「自媒体爆款标题生成器」负责多平台标题分发——三个技能在同一个客户端按顺序调用,从 Prompt 到可发布素材一站式完成。基础版永久免费,先把工作流跑通。

免费下载体验 →

AI 视频脚本怎么写 · 高频问题

AI 视频脚本和短视频脚本是同一回事吗?
"短视频脚本"指内容形式(15s-3min的视频文案),"AI 视频脚本"指写作方式(用 AI 模型辅助生成)。两者交集很大,本指南讲的就是"用 AI 写短视频脚本",所以"AI 视频脚本怎么写"和"ai创作脚本"问题在本页都能找到答案。
ai 创作脚本时,是用中文 Prompt 还是英文 Prompt 好?
写文字脚本(口播 + 分镜)用中文 Prompt,输出符合中文语境;衔接到视频生成(文生视频 / 图生视频)时用英文 Prompt,因为视频生成模型多数是基于英文训练的,对景别 / 运镜术语的英文表达识别更准。本页给到的视频生成 Prompt 公式就是中英双语,可以直接拼接使用。
让 AI 一次出脚本和分镜,还是分两轮?
分两轮。一次让 AI 出"主题 → 时间轴口播脚本",第二次让 AI "把上面脚本拆成三列分镜表"。原因:脚本和分镜是两层信息密度,混在一起 AI 容易顾此失彼,要么口播好分镜糊,要么分镜细口播平。分两轮各自专注,质量都能上来。
分镜文案里景别和运镜的词是不是越多越好?
不是。建议把景别限定在 4-5 个词(特写 / 近景 / 中景 / 全景 / 越肩),运镜限定在 5-6 个词(固定 / 推拉 / 平移 / 跟拍 / 手持 / 环绕)。词表越小,剧组拍摄时越统一,AI 输出也越收敛。专业剧组才会用到几十种术语,新手用 5+5 即可。
文生视频和图生视频,做短视频素材选哪个?
需要"系列内容、角色一致"用图生视频——锁定第一帧后角色 / 场景一致性高,适合 IP 形象视频。需要"快速产出多版本试错"用文生视频——只输入文字描述即可。EasyClaw 的「视频生成」技能两种模式都支持,单次生成约消耗 30 秒到几分钟,初期建议先试文生视频快速过稿。
用 AI 生成的视频素材合规吗?商用可以吗?
需要分两层判断:① 模型版权——主流国产视频生成模型(如火山引擎 Seedance)通常允许商用,使用前查阅服务条款;② 素材内容——避免生成明确知名公众人物、注册商标产品、品牌 Logo 等可能引发肖像权 / 商标权问题的内容。本指南讲的工作流仅用于内容创作辅助,正式商用前建议你做一次内容审核。
AI 视频脚本写出来后,剪辑师还需要做什么?
剪辑师拿到的应该是含 3 列的分镜表。他需要做:① 按表中"画面"列拍摄或检索素材;② 按"口播"列录配音;③ 按"时间段"列对齐节奏。AI 帮你做完了"想"的环节,"做"的环节仍然需要人。这也是为什么 AI 不会替代视频创作者——它替代的是流程里重复的部分。
短 视频 脚本 ai 写作和"AI视频脚本怎么写"是同一个问题吗?
本质是同一个问题,搜索词不同而已。"短 视频 脚本 ai 写作"偏向"用AI写短视频脚本的工作流"(更细分),"AI视频脚本怎么写"偏向"AI辅助下的视频脚本通用方法"(更宽泛)。本页 5 要素结构同时覆盖这两个搜索意图,按你的具体场景挑步骤实操即可。

短视频制作的其他关键环节