一句话让 Opus 5.5 做出视频:它自己跑的五步和工具
用 Opus 5.5 做视频:写稿、配音、画面、字幕、合成五步全由 AI 自己完成。每步用什么工具、五种画面路线怎么选,附一句话提示词。

想做视频,又不会剪辑画画,还不想露脸?最近刷到不少 Opus 5.5 一句话做出来的动画视频,想自己试试,结果连要装什么都不知道。
其实你要做的很少:说一句要什么,最后看一遍成片。中间写稿、配音、做画面、上字幕、合成这五步,全是 AI 自己干的,工具它自己装,命令它自己跑。
唯一的前提:得用一个能在你电脑上跑命令的 AI,比如 Claude Code。网页上聊天的那种只能出主意,做不出视频文件。
我刚这样做了一条 6 分钟的讲解视频。丢给它一个参考链接加一句话,二十分钟后成片就出来了:41 张插图,中文配音,中英双语字幕。花钱的只有画图,按张算,别的全免费。

AI 自己跑的五步
这五步你不用动手。知道它在干什么就够了,哪步不满意,你能说清楚让它改哪。
| 步骤 | 它干什么 | 它用的工具 |
|---|---|---|
| 1. 写稿 | 把整条视频写成一个稿子文件 | 模型自己 |
| 2. 配音 | 把稿子念出来,量出时长 | edge-tts、MiniMax、ElevenLabs |
| 3. 做画面 | 按时长出图、出动画或出视频片段 | 看走哪条路线 |
| 4. 上字幕 | 照配音的时间点对齐,做进画面 | 配音工具自带、Whisper |
| 5. 合成 | 画面、声音、字幕拼成一条 | ffmpeg、Remotion |
它会按这个顺序来:先有稿子,再配音,时长定了才做画面。
1. 写稿
- 一个稿子管到底。 它把每句的配音、字幕、配什么画面全写进一个文件,后面每一步都照着这个文件来。
- 有参考先拆解。 你给了参考视频,它会用 yt-dlp 下下来,用 Whisper 转成文字稿,看明白了再动笔。
- 核实事实。 它会联网查稿子里的研究和数据。我那条参考视频里有个“研究”怎么都查不到,它自己换成了真实来源。
2. 配音
它会挑一个配音工具把稿子念出来。你有偏好,跟它说一声就行:
- 默认免费的: 微软的 edge-tts,中文不错。
- 想更像真人,或者用你自己的声音: MiniMax、ElevenLabs,都能克隆声音。
- 想在本机跑: 开源的 CosyVoice。
配完它会先量时长。长了删稿,短了补稿,对上了才往下走,免得画了半天用不上。
3. 做画面
这一步花钱最多,效果差别也最大,关键看走哪条路线。你不说它会自己挑,想指定就跟它说一声。
| 路线 | 适合 | 画面工具 | 成本 |
|---|---|---|---|
| 代码动画 | 产品介绍、数据图表、文字动效 | Remotion、Manim | 几乎免费 |
| 插图配音 | 知识讲解、读书分享 | gpt-image、Nano Banana、即梦 | 按张付费 |
| AI 生成视频 | 广告、剧情、镜头感强的片段 | Veo、可灵、Seedance、海螺 | 最贵 |
| 录屏 | 软件教程、产品演示 | AI 操作浏览器,边做边录 | 免费 |
| 数字人口播 | 要有人出镜,但不想露脸 | HeyGen、即梦数字人 | 订阅 |
- 代码动画: Opus 5.5 刷屏的那些动画,大多走的这条路。它像写网页一样把每一帧写出来,再渲染成视频,字和数字都清楚,改起来也快。Remotion 个人用免费。
- AI 生成视频: 最有电影感,可每段就几秒钟,同一个人换个镜头可能就变了样。拿来当点缀挺好,整条都靠它就太难了。
新手我建议先从插图或代码动画上手,便宜,改起来也不心疼。下面这几条它一般会自己注意,没做到就提醒它一句:
- 人物长相写死。 每张图的提示词里都写上同一个人物外貌,主角才不会每张换一张脸。
- 图里不写字。 AI 画的字十有八九是乱码,字交给字幕或者代码去做。
- AI 视频按镜头拆。 一个镜头生成一段,最后再拼起来。
4. 上字幕
- 时间点它自己对。 配音工具会告诉它每个字在第几秒,它照着对齐。你给的是录好的音,它就用 Whisper 反推时间。
- 字幕做进画面。 很多平台是静音自动播放的,没字幕人家根本不知道你在说啥。
5. 合成
- ffmpeg: 它最熟的剪辑工具,推拉镜头、叠字幕、拼接、调音量,几条命令就搞定。
- Remotion: 走代码动画的话,它直接用 Remotion 导出成片。
背景音乐想要的话,用 Suno 生成一段丢给它,商用记得开付费版。成片出来还想手动抠细节,就拖进剪映。
你要做的就三件事
- 说一句要什么。 参考或题目、多长、发哪,够了。
- 复查来源。 它核实过的来源,你最好也点开看一眼,换上的不一定对。
- 完整看一遍。 它检查视频一般是抽几帧截图,不会整条看完,发之前你自己从头看到尾。
发之前注意
- 画幅跟着平台走。 告诉它发哪,它会出对应的画幅:X、YouTube、B 站横屏,抖音、视频号、Reels 竖屏。
- 第一帧就出标题。 不然别人划一下就过去了,没放就让它加上。
- X 长视频要 Premium。 超过 2 分 20 秒就得有,这个只能你自己搞定。
贴给 AI 的话
我当时就说了一句“参考这个视频,做一个 6 分钟适合发推特的视频”,剩下的全是它自己来。换成你的:
帮我做一个 <几分钟> 的视频,发 <平台>,讲 <题目,或者贴个参考视频链接>。
你想拿 AI 做什么视频?卡在哪一步了?