商业模式

【创意视频】用AI制作专属猫咪Vlog的保姆级图文教程

2个月前 AI猫咪Vlog实操指南 作者:西瓜
AI视频制作
猫咪Vlog
角色一致性
提示词技巧
视频工作流
最近我做了一支“上班族”AI橘猫Vlog,真实的疲惫感和班味让很多人共鸣。这篇教程将拆解完整工作流,教你保持猫咪形象统一,去除塑料CG感,做出更真实的宠物短片。

一起来看一下成品:

那么接下来,按照我的思路和步骤,你也可以做出这样的作品,一起来实操吧~

准备工具


使用多个平台模型进行生成

Nano banana pro https://labs.google/fx/tools/flow/

Gemini(https://gemini.google.com)

即梦AI (https://jimeng.jianying.com/ai-tool/generate)

可灵 https://kling.ai/



第一步:创建专属的猫咪“数字分身”


视频成功的基石是主角形象的一致性。我们需要先为猫咪建立一个标准的“角色参考图”。

我从网络上找到一只橘猫

使用nano banana pro(需要梯子)进行三视图生成。

输入提示词:

生成这个猫咪的4视图,最左侧是大头照,右侧是3视图,保持写实风格,白底图



第二步:利用大模型拆解爆款脚本


面对空白屏幕容易没有灵感,我们可以让AI帮我们搭建故事骨架。

寻找对标:

在短视频平台下载一个你觉得节奏和运镜都不错的宠物Vlog(或普通Vlog)作为参考。

多模态输入:

将下载的视频文件,连同你第一步生成的“猫咪四视图”一起上传给 Gemini。

实操提示词:

“帮我分析一下这个AI制作的猫咪vlog视频。我要制作一个属于自己的猫咪vlog视频,不要完全学习视频中一样的内容,帮我想一下2分钟的视频内容与分镜,符合中国上班族的一天。”

核心逻辑:

这一步是让AI学习原视频的叙事节奏,同时结合你限定的“中国上班族”背景,生成本土化的全新剧情。



第三步:定制“高真实感”的分镜提示词


有了基础脚本,接下来要将其转化为生图提示词。AI默认倾向于生成完美的电影画质,我们需要打破这种完美。

实操提示词:

“基于上述分镜,给我每一个画面的AI生图提示词。必须是中文。拍摄画质需要手机拍摄质感,保持真实随手拍的感觉,光线不要太完美,带有日常环境的杂乱感。”

细节控制:

明确要求AI在提示词中加入视角设定(如:第一人称POV视角、自拍视角、监控视角等),这会极大增强Vlog的代入感。



第四步:人工润色与静态分镜生成


AI生成的提示词只是初稿,直接使用往往会翻车,必须经过人工微调。

举例1:

这是AI生成的提示词

这是我更改后的提示词:

手机真实拍摄质感,低画质。昏暗的中国公寓卧室里,一只橘猫穿着一件深蓝色格子睡衣,脸生无可恋地埋在枕头里。一只猫爪烦躁地拍打着床头柜上亮起的智能手机。手机屏幕反光刺眼,屏幕上清晰显示着7:10的闹钟响起(手机内的画面参考图2)。画面有手持轻微晃动感。

我增加了:脸生无可恋,烦躁地拍打,
更改了:手机真实拍摄质感,屏幕上清晰显示着7:10的闹钟响起(手机内的画面参考图2)。

参考图2如下

图生图生成

举例2:

这是AI生成的提示词

这是我更改后的提示词:

手机随手放置在洗手台上拍摄的固定视角,光线昏暗,构图随意。图1橘猫,穿着一件深蓝色格子睡衣,站在中国家庭的卫生间镜子前,洗手台上放着大宝和百雀羚的瓶子。猫咪一只手拿着电动牙刷,塞到嘴里,眼神依然坚定但略显麻木地盯向前方镜子。画面边缘有轻微镜头畸变。

我增加了:穿着一件深蓝色格子睡衣

更改了:猫咪一只手拿着电动牙刷,塞到嘴里

图生图

查漏补缺:

如果发现场景A到场景B的跳跃感太强,根据逻辑自己补充一张过渡分镜的提示词。分镜图越连贯,最终的视频越自然。

以下是其他几张图的生成提示词,都进行了润色

分镜3

提示词:

场景 3:极速通勤 自拍视角,手机手持自拍,手机随手拍质感,画面晃动,清晨刺眼阳光直射。由于是猫的自拍,所以视角较低,背景都是人的腿部,一只橘猫(图1)站在街边拥挤早餐摊前,一只手拿着塑料袋包着的煎饼果子往嘴里送。眼睛盯着屏幕

分镜4

提示词:

(进地铁-POV视角)手机随手拍质感,环境参考图2,手机第一人称主观视角。一只猫爪拿着手机,手机背对镜头,放在扫码处

分镜5

提示词:

手机前置镜头自拍视角,超广角变形,中国的地铁超级拥挤。都没有空位可以站立。由于是猫的自拍,所以视角较低,背景都是人的腿部,猫脸被挤得变形,眼神疲惫,困倦。手机随手拍,手持晃动。

分镜6

提示词:

手机摆在办公桌上,超低视角仰视,前景是键盘微微遮挡。手机前置拍摄质感,距离猫咪很近,白天,桌堆满文件,背后是很多工位,工位上都是人在办公。一只爪子搭在键盘上,一只在使用鼠标。桌子上有一杯瑞幸咖啡,猫咪坚定的黄绿色眼睛依然锐利地盯着前方

分镜7

提示词:

镜头改到左侧方(环境随镜头变化而变化),近距离特写,猫咪拿起瑞幸,喝咖啡

使用分镜6进行图生图

分镜8

提示词:

(自拍吃播视角) 手机自拍视角,超低视角,超级仰视拍摄,镜头从轻食碗的视角拍摄,环境参考图3(去掉桌子上的键盘。瑞幸咖啡,去掉背景中的人)桌上放着图2的轻食,图1的橘猫爪子拿起几片个虾仁送入口中

找了一张轻食素材以及分镜6一起进行图生图

分镜9

提示词:

特写猫咪面部,公司卫生间蹲坑场景,(画面中只露出猫猫头,和卫生间背景去暗示厕所环境,不要出现马桶)手机前置摄像头自拍仰拍视角(低角度从下往上拍),带有自拍视角的轻微鱼眼畸变和广角拉伸感,眼神直视镜头,表情呆滞又认真。背景是卫生间天花板和顶部灯光,手机前摄随手拍风格。暖色顶光,幽默荒诞氛围,类似人类自拍角度。

分镜10

提示词:

将画面改成猫咪的侧后方视角(环境也随之改变,展现出电脑屏幕),背景环境可依据你的想法变化

对分镜6进行图生图

分镜11

提示词:

自拍视角,手机手持自拍,猫咪是主角,手机自拍的画质。视角略微有些下颌角度,猫咪只露出头部,图1的猫咪后躺在家中的沙发上,另一只爪子往嘴里送零食。环境较暗但温馨。猫咪神情放松。

分镜12

提示词:

自拍视角,特写猫咪面部,猫咪完全侧躺在枕头上

使用这张图片再次进行图生图

prompt:

关闭屋内灯光,只留下手机屏幕照在脸上的光



第五步:图生视频,赋予画面动态与灵魂


这是最考验耐心的一步。将满意的静态图转化为动态视频。

选择工具: 本视频使用了 Veo 3.1、可灵 V3、Seedance 2.0 等视频生成模型交替配合。

化繁为简的提示词: 视频大模型的提示词不需要像画图时那么复杂。重点只写两件事:摄影机运动 + 主体微小动作。

举例:

例如附分镜1提示词:

手机上的闹钟响起,猫咪睁开眼后,伸出爪子烦躁的关闭闹钟,随后翻了个身

顺序极其清晰: 响-睁-关-翻。就像给演员递剧本,动作一环扣一环,AI处理起来就不会“手脚并用”导致穿模。

全是实在动词: 没有写“清晨的慵懒”这种虚词,全是“睁眼、伸爪、翻身”这种立刻能出画面的物理动作,不难为AI的理解能力。

“烦躁”是灵魂: 加了这俩字,AI立刻就懂了猫的力度和微表情,定住了画面的基调。

例如附分镜5提示词:

猫咪俩眼无神的看着镜头,然后左看看,右看看,自拍视角也跟随着左右移动

第一句定神态:“俩眼无神”。 上来直接把面部表情锁死,精准拿捏了打工人的“班味”基调,AI就不会乱发挥,去生成卖萌或微笑的表情。

第二句定顺序:“然后左看右看”。 用“然后”切分了时间线。先死鱼眼盯镜头(静),再左右转头(动)。一静一动,主次分明,动作逻辑绝对清晰。

第三句是精髓:“视角跟随移动”。 这是最妙的一笔!把主体的动作和镜头的运动死死绑定在了一起。它明确告诉AI这是“自拍镜头”,脑袋转,镜头就得跟着晃。这极大地增强了第一人称视角的真实感,也有效防止了AI瞎转镜头导致背景穿模崩坏。

例如附分镜6提示词:

猫咪的一只爪子在鼠标上,鼠标桌子滑动,另一只爪子在键盘上快速敲击。背景里虚化的同事在走动和交谈。

肢体分工极度明确: 一只爪子鼠标,另一只爪子键盘。

动作频率拉满: 鼠标“滑动”加上键盘“快速敲击”,动词不仅具体,还自带节奏感。AI立刻就能领会到那种疯狂赶工的职场紧绷感。

“虚化”是神来之笔: 既要求有“同事走动交谈”来烘托办公室的真实氛围,又特意加了“虚化”两个字。这等于在告诉AI:“背景随便糊弄一下有个动态就行,把好钢(算力)全用在刀刃(猫)上!”主次极其分明。

其他的视频提示词都在工作流里,都比较简单,可以自行查看

https://www.flowpix.club/bj/14334.html?token=a19b5dd105bf418e420a2f4a975a1dd4



第六步:后期剪辑


在剪映中,按照顺序简单拼接一下,再配上字幕

BGM:

在音频中搜索‘’哈基米‘’即可

最后在评论区上传您的作品,一起讨论吧~


速用卡

角色设计执行卡

把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。

一句话重点

这节课不是让你照着参考图抄脸,而是围绕「用AI制作专属猫咪Vlog的保姆级图文教程」把原创角色脸拆成结构、比例、五官主次和妆造记忆点。

落地顺序

按原文节奏走最稳:先吃透「准备工具」,再把「第一步:创建专属的猫咪“数字分身”」定住,接着处理「第二步:利用大模型拆解爆款脚本」;最后用「第三步:定制“高真实感”的分镜提示词」收口。

照着做清单
  1. 先把「准备工具」里说的脸型或气质定住。
  2. 围绕「第一步:创建专属的猫咪“数字分身”」收一收五官,不要让每个部位都抢戏。
  3. 做完「第二步:利用大模型拆解爆款脚本」后,先确认角色还是原创。
  4. 把「第三步:定制“高真实感”的分镜提示词」整理成可复制版本,后面直接复用。
  5. 围绕「第四步:人工润色与静态分镜生成」收一收五官,不要让每个部位都抢戏。
  6. 做完「第五步:图生视频,赋予画面动态与灵魂」后,先确认角色还是原创。
最容易踩坑

不要直接套真人脸或影视角色脸;不要把所有五官都做成强特征,否则容易撞脸、割裂、不稳定。

成品自检

检查角色是否有清晰记忆点;年龄感和气质是否一致;换妆造后脸是否稳定;是否不像任何明确真人或影视角色。

可直接复制的万能模板
请围绕「用AI制作专属猫咪Vlog的保姆级图文教程」帮我做一个可直接执行的方案。
我的目标是:【填写你的具体目标】
我的素材/产品/角色信息是:【填写已有素材和限制】

请输出:角色定位、脸型方向、三庭五眼比例、五官主次、妆造记忆点、完整生图提示词。要求原创、有辨识度、避免撞脸和网红脸。