最近朋友圈玩AI视频的人肉眼可见地多了,但大家症状都差不多:提示词写了一大堆,几百上千字伺候着,生成出来的画面还是不对味——要么人物走着走着背景就变形了,要么镜头切得莫名其妙,只能一遍遍重抽,抽到怀疑人生。
今天量子位发了篇文章,讲了个挺颠覆的解法:先别急着写提示词,先生成一个粗糙的3D白模场景,把机位、人物走位、镜头运动全定好,录一段"预演视频",再丢给AI视频模型去渲染成片。说白了,这就是电影行业用了多少年的老办法——开拍前先做分镜预演,如今被搬进了AI视频创作。
为啥这招管用?因为文字本身就说不清"拍什么"。你写"镜头缓缓推进",模型根本不知道推多快、推到哪;你写"人物从画面左侧横穿",它也不知道人物离镜头多远、走什么路线。写2000字提示词,等于让AI做两次翻译,信息损耗巨大,最后只能靠抽卡碰运气。而3D白模把空间、位置、运动轨迹这些"说不清道不明"的东西,直接变成模型看得懂的坐标信息——材质光影交给AI自由发挥,空间结构不许乱来,翻车率自然就下来了。
以前这套流程普通人根本碰不了,想学Blender、Maya,光入门就得啃好几个月。现在新工具把门槛打下来了:拿updream的预演台举例,传一两张场景参考图,几分钟就能生成白模,画条走位线、摆几个机位就能录预演视频,再交给Seedance、可灵、即梦这些模型出片。量子位的记者亲测,一镜到底、多机位切换这类最容易翻车的场景,加了白模之后稳定得多。
这事对普通人意味着什么?我觉得有两层。第一,AI视频的门槛又降了一截,以前拼的是提示词文采,现在拼的是你脑子里有没有画面——懂不懂分镜,有没有镜头感。第二,也是最扎心的:工具越傻瓜,越拼审美和叙事能力,会用的人正在加速吃掉不会用的人的市场。
我的判断就一句话:AI视频的下一个分水岭,不是谁的工具更先进,而是谁脑子里先有画面。工具再强,也只是把你脑子里那点东西实现出来;想不清楚,什么模型都救不了你。
AI视频

