我先说个挺尴尬的经历。
之前我做过一条 AI 工具类短视频,脚本写了差不多 900 字,看着很完整,开头、观点、总结都有。结果真到拍的时候,我卡住了。
第一段还能出镜口播,第二段开始就不知道该配什么画面。剪辑的时候更难受,整条视频像是在念一篇短文章,画面只能来回切电脑屏幕、头像、字幕,看起来特别干。
那次之后我才意识到:短视频脚本不是把文章写短,而是要提前想清楚“这句话对应什么画面”。
后来我开始用 Gemini 3.5 辅助写脚本。平时我会在元壹AI聚合平台上切不同模型做对比,同一个选题先让 Gemini 3.5 拆画面,再用其他模型润色表达。对短视频创作来说,这种聚合平台的好处很直接:不用来回登录账号,也方便测试哪个模型更适合哪一步。
我现在用 Gemini 3.5 最多的地方,不是让它一口气写完整脚本,而是让它帮我把选题拆成可拍的分镜、逐字稿和字幕。
这篇就按我自己的流程讲,尽量不讲空话。
一、我现在不会一上来让它写全文
以前我最常用的提示词是:
帮我写一条关于 AI 提效的短视频脚本。
它确实会写,而且速度很快。
但问题是,写出来的东西往往像这样:
今天给大家分享一个提升短视频创作效率的方法,使用 Gemini 3.5 可以帮助我们快速完成选题策划、脚本撰写和内容优化。
这段话不能说错,但放到镜头前就很像念稿。更麻烦的是,它没有画面。
所以我现在第一步不会让 Gemini 3.5 写全文,而是先让它判断这个选题能不能拍。
我一般会这样问:
我准备做一条短视频,主题是“用 Gemini 3.5 写分镜脚本和逐字稿”。
先不要写脚本,请帮我判断:
这个选题适合什么账号?
用户最具体的痛点是什么?
哪些内容能用画面展示?
哪些内容只能口播?
建议做 30 秒、60 秒还是 90 秒?
这一步看起来慢,其实能省很多事。
比如“AI 提升创作效率”这个选题就太空了,不好拍。但如果换成“从一句选题拆成分镜脚本和逐字稿”,画面就出来了:输入选题、生成分镜、改口播、整理字幕、对比修改前后。
短视频最怕的不是观点少,而是每一段都只能靠嘴说。
二、先拆画面,不然拍摄时一定会卡
我现在写脚本的顺序是反过来的:先拆画面,再写口播。
很多人会先写逐字稿,然后再想“这里配什么画面”。我以前也是这么干的,结果经常拍到一半发现接不上。
现在我会先让 Gemini 3.5 给我拆一条画面线。
提示词大概是:
请把这个选题拆成一条 60 秒短视频的画面线。
要求:
每 5-8 秒一个镜头;
每个镜头都要写清楚画面里出现什么;
不要写“展示相关画面”这种空话;
要具体到能拍、能录屏、能剪辑。
如果它给我写:
“展示 AI 工具界面”
我会继续追问:
具体展示哪个界面?输入什么内容?鼠标点哪里?字幕出现什么?
我希望它改成这种:
0-5秒:博主面对镜头,电脑屏幕上打开一份空白脚本文档。
5-12秒:录屏输入“先拆画面线,不要直接写全文”。
12-20秒:画面切到 Gemini 3.5 输出结果,高亮“镜头、画面、口播、字幕”四列。
20-35秒:左右对比,左边是普通口播稿,右边是分镜脚本。
35-50秒:展示逐字稿生成过程,重点标出短句和停顿。
50-60秒:回到出镜,总结这套流程。
这种分镜我拿到之后,基本能判断这条视频能不能拍。
如果画面线都拆不出来,说明选题还不够具体,或者角度需要再改。
三、逐字稿别写太完整,越完整越像念稿
分镜确定后,我才会让 Gemini 3.5 写逐字稿。
但这里有个坑:它很容易写得太顺。
比如原始版本可能是:
在短视频创作过程中,分镜脚本和逐字稿可以帮助创作者提升内容表达效率,让拍摄和剪辑更加清晰。
这句话看着没问题,但我自己不会这么说。
我会改成:
你有没有发现,AI 写的脚本看着挺顺,但真到拍的时候,不知道该拍什么?
这两句话表达的意思差不多,但后者更像真人口播,也更容易把用户拉进来。
所以我给 Gemini 3.5 的要求会很细:
请根据上面的分镜写一版 60 秒逐字稿。
要求:
每句话尽量短;
像真实博主口播;
不要写得像文章;
开头 3 秒直接说痛点;
每段口播都要对应具体画面;
不要用“赋能、闭环、优化流程、打造矩阵”这类词。
我还会补一句:
如果一句话读出来不自然,请直接改成更口语的说法。
这句话挺有用。因为 AI 很容易把句子写得完整,但短视频口播不需要那么完整。很多时候,短一点、断一点,反而更像人说话。
比如:
别急着让 AI 写全文。
先让它拆画面。
不然你拍的时候一定会卡。
这种句子不高级,但镜头前说出来更自然。
四、我最常用的是四列表
现在我写短视频脚本,基本都会让 Gemini 3.5 整理成四列表:
请把脚本整理成四列:
镜头时间、画面内容、逐字口播、屏幕字幕。
要求:
画面必须具体;
口播一句不要太长;
字幕只提炼重点,不要逐字照抄;
每个镜头控制在 5-8 秒。
这个格式对我来说最省事。
拍摄时看“画面内容”,录音时看“逐字口播”,剪辑时看“屏幕字幕”。不用在一大段文字里来回找。
举个我会用的版本:
0-5秒
画面:博主看着 AI 生成的长脚本,停顿两秒。
口播:AI 写的脚本,为什么总是不好拍?
字幕:AI 脚本不好拍?
5-12秒
画面:录屏输入“先拆画面线,不要写全文”。
口播:问题不一定是 AI 不会写,而是你问早了。
字幕:别急着写全文
12-20秒
画面:高亮 Gemini 3.5 输出的镜头结构。
口播:我现在会先让它拆镜头。
字幕:先拆镜头,再写口播
我自己的习惯是,表格出来之后不会直接用。
我会先读一遍口播。如果某句话我读起来别扭,就删。再看画面,如果某个镜头我当天拍不了,也删。
AI 给的是初稿,不是成片方案。
五、让它从剪辑角度挑毛病
脚本写完后,我会让 Gemini 3.5 再检查一遍。
这份脚本写得好吗?
这种问题太泛了,它大概率会夸你结构清晰。
我会直接让它扮演剪辑师来挑问题:
请从短视频剪辑师的角度检查这份脚本。
重点看:
哪些镜头太虚,实际不好拍;
哪些口播太像念稿;
哪些字幕太长;
前 3 秒有没有停留理由;
哪一段节奏拖慢。
请直接指出问题,并给出修改建议。
这一步经常能发现问题。
比如它可能会提醒我:“展示创作流程”太笼统,应该改成“录屏展示从一句选题生成四列表脚本”。也可能会指出某句字幕太长,手机屏幕上会压住画面。
我做 AI 工具类账号时,素材其实很有限:出镜、录屏、对比截图、简单标注。正因为素材有限,脚本里的每个镜头更要具体。
否则剪辑时就会变成一堆空镜头硬凑。
六、不同平台,我会改不同开头
同一条脚本,我不会完全原样发所有平台。
抖音要快一点,视频号可以稳一点,小红书更适合经验分享。不是内容变了,而是开头和语气要变。
我会让 Gemini 3.5 分别改三版:
请把这条脚本改成抖音、视频号、小红书三个版本。
抖音版开头更直接;
视频号版表达更稳;
小红书版更像个人经验分享;
核心内容不要变。
比如同一个开头,可以这样改:
抖音版:
别再让 AI 直接写脚本了,难拍就是因为这一步错了。
视频号版:
很多短视频脚本不是写得不好,而是缺少分镜意识。
小红书版:
我之前也让 AI 直接写全文,后来发现真到拍的时候特别卡。
我一般会从里面挑一句,再按自己的说话习惯改一下。
这一步别偷懒。平台语气不一样,开头差一点,完播率可能就差很多。
七、我的完整流程
现在我用 Gemini 3.5 写短视频脚本,大概就是这几步:
先判断选题能不能拍。
不要急着写全文,先看有没有具体画面。
再拆画面线。
每 5-8 秒一个镜头,越具体越好。
然后写逐字稿。
句子要短,能说出口,不要像文章。
接着整理成四列表。
镜头、画面、口播、字幕放在一起。
最后让它从剪辑角度挑毛病。
重点看哪里虚、哪里拖、哪里不好拍。
听起来步骤多,但实际做熟之后很快。现在一条 60 秒视频,我从选题到可拍脚本,通常比以前省一半时间。更重要的是,拍摄时不会一直卡在“这段到底配什么画面”。
八、AI 是脚本搭子,不是替你当博主
我现在对 Gemini 3.5 的定位很清楚:它适合帮我拆结构、补画面、整理逐字稿,也适合帮我检查节奏。
但它不能替我判断账号风格。
比如我的粉丝关心的是 AI 工具怎么真正落地,而不是模型参数有多强。所以我最后一定会自己过三遍:
这句话我能不能自然说出口?
这个镜头我能不能当天拍出来?
用户前三秒有没有理由继续看?
只要有一个答案是否定的,我就会改。
所以,用 Gemini 3.5 写短视频脚本,关键不是让它一次生成完整成片,而是把它放进你的创作流程里。
先拆画面,再写口播,再做分镜,最后检查可拍性。
这样写出来的脚本,才不像一篇被缩短的文章,而更像一条真正能拍、能剪、能发布的短视频。!