ones.pub

aivideo

一句话让 Opus 5.5 做出视频:它自己跑的五步和工具

用 Opus 5.5 做视频:写稿、配音、画面、字幕、合成五步全由 AI 自己完成。每步用什么工具、五种画面路线怎么选,附一句话提示词。

想做视频,又不会剪辑画画,还不想露脸?最近刷到不少 Opus 5.5 一句话做出来的动画视频,想自己试试,结果连要装什么都不知道。

其实你要做的很少:说一句要什么,最后看一遍成片。中间写稿、配音、做画面、上字幕、合成这五步,全是 AI 自己干的,工具它自己装,命令它自己跑。

唯一的前提:得用一个能在你电脑上跑命令的 AI,比如 Claude Code。网页上聊天的那种只能出主意,做不出视频文件。

我刚这样做了一条 6 分钟的讲解视频。丢给它一个参考链接加一句话,二十分钟后成片就出来了:41 张插图,中文配音,中英双语字幕。花钱的只有画图,按张算,别的全免费。

成片里的一帧:AI 画的插图,加中英双语字幕

AI 自己跑的五步

这五步你不用动手。知道它在干什么就够了,哪步不满意,你能说清楚让它改哪。

步骤 它干什么 它用的工具
1. 写稿 把整条视频写成一个稿子文件 模型自己
2. 配音 把稿子念出来,量出时长 edge-tts、MiniMax、ElevenLabs
3. 做画面 按时长出图、出动画或出视频片段 看走哪条路线
4. 上字幕 照配音的时间点对齐,做进画面 配音工具自带、Whisper
5. 合成 画面、声音、字幕拼成一条 ffmpeg、Remotion

它会按这个顺序来:先有稿子,再配音,时长定了才做画面。

1. 写稿

  • 一个稿子管到底。 它把每句的配音、字幕、配什么画面全写进一个文件,后面每一步都照着这个文件来。
  • 有参考先拆解。 你给了参考视频,它会用 yt-dlp 下下来,用 Whisper 转成文字稿,看明白了再动笔。
  • 核实事实。 它会联网查稿子里的研究和数据。我那条参考视频里有个“研究”怎么都查不到,它自己换成了真实来源。

2. 配音

它会挑一个配音工具把稿子念出来。你有偏好,跟它说一声就行:

  • 默认免费的: 微软的 edge-tts,中文不错。
  • 想更像真人,或者用你自己的声音: MiniMax、ElevenLabs,都能克隆声音。
  • 想在本机跑: 开源的 CosyVoice。

配完它会先量时长。长了删稿,短了补稿,对上了才往下走,免得画了半天用不上。

3. 做画面

这一步花钱最多,效果差别也最大,关键看走哪条路线。你不说它会自己挑,想指定就跟它说一声。

路线 适合 画面工具 成本
代码动画 产品介绍、数据图表、文字动效 Remotion、Manim 几乎免费
插图配音 知识讲解、读书分享 gpt-image、Nano Banana、即梦 按张付费
AI 生成视频 广告、剧情、镜头感强的片段 Veo、可灵、Seedance、海螺 最贵
录屏 软件教程、产品演示 AI 操作浏览器,边做边录 免费
数字人口播 要有人出镜,但不想露脸 HeyGen、即梦数字人 订阅
  • 代码动画: Opus 5.5 刷屏的那些动画,大多走的这条路。它像写网页一样把每一帧写出来,再渲染成视频,字和数字都清楚,改起来也快。Remotion 个人用免费。
  • AI 生成视频: 最有电影感,可每段就几秒钟,同一个人换个镜头可能就变了样。拿来当点缀挺好,整条都靠它就太难了。

新手我建议先从插图或代码动画上手,便宜,改起来也不心疼。下面这几条它一般会自己注意,没做到就提醒它一句:

  • 人物长相写死。 每张图的提示词里都写上同一个人物外貌,主角才不会每张换一张脸。
  • 图里不写字。 AI 画的字十有八九是乱码,字交给字幕或者代码去做。
  • AI 视频按镜头拆。 一个镜头生成一段,最后再拼起来。

4. 上字幕

  • 时间点它自己对。 配音工具会告诉它每个字在第几秒,它照着对齐。你给的是录好的音,它就用 Whisper 反推时间。
  • 字幕做进画面。 很多平台是静音自动播放的,没字幕人家根本不知道你在说啥。

5. 合成

  • ffmpeg: 它最熟的剪辑工具,推拉镜头、叠字幕、拼接、调音量,几条命令就搞定。
  • Remotion: 走代码动画的话,它直接用 Remotion 导出成片。

背景音乐想要的话,用 Suno 生成一段丢给它,商用记得开付费版。成片出来还想手动抠细节,就拖进剪映。

你要做的就三件事

  • 说一句要什么。 参考或题目、多长、发哪,够了。
  • 复查来源。 它核实过的来源,你最好也点开看一眼,换上的不一定对。
  • 完整看一遍。 它检查视频一般是抽几帧截图,不会整条看完,发之前你自己从头看到尾。

发之前注意

  • 画幅跟着平台走。 告诉它发哪,它会出对应的画幅:X、YouTube、B 站横屏,抖音、视频号、Reels 竖屏。
  • 第一帧就出标题。 不然别人划一下就过去了,没放就让它加上。
  • X 长视频要 Premium。 超过 2 分 20 秒就得有,这个只能你自己搞定。

贴给 AI 的话

我当时就说了一句“参考这个视频,做一个 6 分钟适合发推特的视频”,剩下的全是它自己来。换成你的:

帮我做一个 <几分钟> 的视频,发 <平台>,讲 <题目,或者贴个参考视频链接>。

你想拿 AI 做什么视频?卡在哪一步了?