我用 Gemini 3.5 写短视频脚本后才明白:真正提效的不是写稿,而是先拆画面

我先说个挺尴尬的经历。

之前我做过一条 AI 工具类短视频,脚本写了差不多 900 字,看着很完整,开头、观点、总结都有。结果真到拍的时候,我卡住了。

第一段还能出镜口播,第二段开始就不知道该配什么画面。剪辑的时候更难受,整条视频像是在念一篇短文章,画面只能来回切电脑屏幕、头像、字幕,看起来特别干。

那次之后我才意识到:短视频脚本不是把文章写短,而是要提前想清楚“这句话对应什么画面”。

后来我开始用 Gemini 3.5 辅助写脚本。平时我会在元壹AI聚合平台上切不同模型做对比,同一个选题先让 Gemini 3.5 拆画面,再用其他模型润色表达。对短视频创作来说,这种聚合平台的好处很直接:不用来回登录账号,也方便测试哪个模型更适合哪一步。

我现在用 Gemini 3.5 最多的地方,不是让它一口气写完整脚本,而是让它帮我把选题拆成可拍的分镜、逐字稿和字幕。

这篇就按我自己的流程讲,尽量不讲空话。
20260708205502_18c051b7db8e6f988f63.png

一、我现在不会一上来让它写全文

以前我最常用的提示词是:

帮我写一条关于 AI 提效的短视频脚本。

它确实会写,而且速度很快。

但问题是,写出来的东西往往像这样:

今天给大家分享一个提升短视频创作效率的方法,使用 Gemini 3.5 可以帮助我们快速完成选题策划、脚本撰写和内容优化。

这段话不能说错,但放到镜头前就很像念稿。更麻烦的是,它没有画面。

所以我现在第一步不会让 Gemini 3.5 写全文,而是先让它判断这个选题能不能拍。

我一般会这样问:

我准备做一条短视频,主题是“用 Gemini 3.5 写分镜脚本和逐字稿”。

先不要写脚本,请帮我判断:

这个选题适合什么账号?

用户最具体的痛点是什么?

哪些内容能用画面展示?

哪些内容只能口播?

建议做 30 秒、60 秒还是 90 秒?

这一步看起来慢,其实能省很多事。

比如“AI 提升创作效率”这个选题就太空了,不好拍。但如果换成“从一句选题拆成分镜脚本和逐字稿”,画面就出来了:输入选题、生成分镜、改口播、整理字幕、对比修改前后。

短视频最怕的不是观点少,而是每一段都只能靠嘴说。

二、先拆画面,不然拍摄时一定会卡

我现在写脚本的顺序是反过来的:先拆画面,再写口播。

很多人会先写逐字稿,然后再想“这里配什么画面”。我以前也是这么干的,结果经常拍到一半发现接不上。

现在我会先让 Gemini 3.5 给我拆一条画面线。

提示词大概是:

请把这个选题拆成一条 60 秒短视频的画面线。

要求:

每 5-8 秒一个镜头;

每个镜头都要写清楚画面里出现什么;

不要写“展示相关画面”这种空话;

要具体到能拍、能录屏、能剪辑。

如果它给我写:

“展示 AI 工具界面”

我会继续追问:

具体展示哪个界面?输入什么内容?鼠标点哪里?字幕出现什么?

我希望它改成这种:

0-5秒:博主面对镜头,电脑屏幕上打开一份空白脚本文档。

5-12秒:录屏输入“先拆画面线,不要直接写全文”。

12-20秒:画面切到 Gemini 3.5 输出结果,高亮“镜头、画面、口播、字幕”四列。

20-35秒:左右对比,左边是普通口播稿,右边是分镜脚本。

35-50秒:展示逐字稿生成过程,重点标出短句和停顿。

50-60秒:回到出镜,总结这套流程。

这种分镜我拿到之后,基本能判断这条视频能不能拍。

如果画面线都拆不出来,说明选题还不够具体,或者角度需要再改。

三、逐字稿别写太完整,越完整越像念稿

分镜确定后,我才会让 Gemini 3.5 写逐字稿。

但这里有个坑:它很容易写得太顺。

比如原始版本可能是:

在短视频创作过程中,分镜脚本和逐字稿可以帮助创作者提升内容表达效率,让拍摄和剪辑更加清晰。

这句话看着没问题,但我自己不会这么说。

我会改成:

你有没有发现,AI 写的脚本看着挺顺,但真到拍的时候,不知道该拍什么?

这两句话表达的意思差不多,但后者更像真人口播,也更容易把用户拉进来。

所以我给 Gemini 3.5 的要求会很细:

请根据上面的分镜写一版 60 秒逐字稿。

要求:

每句话尽量短;

像真实博主口播;

不要写得像文章;

开头 3 秒直接说痛点;

每段口播都要对应具体画面;

不要用“赋能、闭环、优化流程、打造矩阵”这类词。

我还会补一句:

如果一句话读出来不自然,请直接改成更口语的说法。

这句话挺有用。因为 AI 很容易把句子写得完整,但短视频口播不需要那么完整。很多时候,短一点、断一点,反而更像人说话。

比如:

别急着让 AI 写全文。

先让它拆画面。

不然你拍的时候一定会卡。

这种句子不高级,但镜头前说出来更自然。

四、我最常用的是四列表

现在我写短视频脚本,基本都会让 Gemini 3.5 整理成四列表:

请把脚本整理成四列:

镜头时间、画面内容、逐字口播、屏幕字幕。

要求:

画面必须具体;

口播一句不要太长;

字幕只提炼重点,不要逐字照抄;

每个镜头控制在 5-8 秒。

这个格式对我来说最省事。

拍摄时看“画面内容”,录音时看“逐字口播”,剪辑时看“屏幕字幕”。不用在一大段文字里来回找。

举个我会用的版本:

0-5秒

画面:博主看着 AI 生成的长脚本,停顿两秒。

口播:AI 写的脚本,为什么总是不好拍?

字幕:AI 脚本不好拍?

5-12秒

画面:录屏输入“先拆画面线,不要写全文”。

口播:问题不一定是 AI 不会写,而是你问早了。

字幕:别急着写全文

12-20秒

画面:高亮 Gemini 3.5 输出的镜头结构。

口播:我现在会先让它拆镜头。

字幕:先拆镜头,再写口播

我自己的习惯是,表格出来之后不会直接用。

我会先读一遍口播。如果某句话我读起来别扭,就删。再看画面,如果某个镜头我当天拍不了,也删。

AI 给的是初稿,不是成片方案。

五、让它从剪辑角度挑毛病

脚本写完后,我会让 Gemini 3.5 再检查一遍。

这份脚本写得好吗?

这种问题太泛了,它大概率会夸你结构清晰。

我会直接让它扮演剪辑师来挑问题:

请从短视频剪辑师的角度检查这份脚本。

重点看:

哪些镜头太虚,实际不好拍;

哪些口播太像念稿;

哪些字幕太长;

前 3 秒有没有停留理由;

哪一段节奏拖慢。

请直接指出问题,并给出修改建议。

这一步经常能发现问题。

比如它可能会提醒我:“展示创作流程”太笼统,应该改成“录屏展示从一句选题生成四列表脚本”。也可能会指出某句字幕太长,手机屏幕上会压住画面。

我做 AI 工具类账号时,素材其实很有限:出镜、录屏、对比截图、简单标注。正因为素材有限,脚本里的每个镜头更要具体。

否则剪辑时就会变成一堆空镜头硬凑。

六、不同平台,我会改不同开头

同一条脚本,我不会完全原样发所有平台。

抖音要快一点,视频号可以稳一点,小红书更适合经验分享。不是内容变了,而是开头和语气要变。

我会让 Gemini 3.5 分别改三版:

请把这条脚本改成抖音、视频号、小红书三个版本。

抖音版开头更直接;

视频号版表达更稳;

小红书版更像个人经验分享;

核心内容不要变。

比如同一个开头,可以这样改:

抖音版:

别再让 AI 直接写脚本了,难拍就是因为这一步错了。

视频号版:

很多短视频脚本不是写得不好,而是缺少分镜意识。

小红书版:

我之前也让 AI 直接写全文,后来发现真到拍的时候特别卡。

我一般会从里面挑一句,再按自己的说话习惯改一下。

这一步别偷懒。平台语气不一样,开头差一点,完播率可能就差很多。

七、我的完整流程

现在我用 Gemini 3.5 写短视频脚本,大概就是这几步:

先判断选题能不能拍。

不要急着写全文,先看有没有具体画面。

再拆画面线。

每 5-8 秒一个镜头,越具体越好。

然后写逐字稿。

句子要短,能说出口,不要像文章。

接着整理成四列表。

镜头、画面、口播、字幕放在一起。

最后让它从剪辑角度挑毛病。

重点看哪里虚、哪里拖、哪里不好拍。

听起来步骤多,但实际做熟之后很快。现在一条 60 秒视频,我从选题到可拍脚本,通常比以前省一半时间。更重要的是,拍摄时不会一直卡在“这段到底配什么画面”。

八、AI 是脚本搭子,不是替你当博主

我现在对 Gemini 3.5 的定位很清楚:它适合帮我拆结构、补画面、整理逐字稿,也适合帮我检查节奏。

但它不能替我判断账号风格。

比如我的粉丝关心的是 AI 工具怎么真正落地,而不是模型参数有多强。所以我最后一定会自己过三遍:

这句话我能不能自然说出口?

这个镜头我能不能当天拍出来?

用户前三秒有没有理由继续看?

只要有一个答案是否定的,我就会改。

所以,用 Gemini 3.5 写短视频脚本,关键不是让它一次生成完整成片,而是把它放进你的创作流程里。

先拆画面,再写口播,再做分镜,最后检查可拍性。

这样写出来的脚本,才不像一篇被缩短的文章,而更像一条真正能拍、能剪、能发布的短视频。!

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容