一、AI 视频的发展
过去,视频制作需要摄影、演员、场景搭建、后期剪辑等多个环节,一个普通人很难独立完成。
随着生成式人工智能的发展,视频创作正在发生改变。从最初的 AI 图片生成,到现在的 AI 视频生成,人工智能已经能够理解文字描述,并将创意转化为具有镜头感的视频内容。
目前主流的 AI 视频生成方式主要是:
文字描述(Prompt) → AI 生成图片 → 图片转视频 → 后期剪辑
这种方式已经成为很多 AI 短视频创作者常用的制作流程。
二、使用 AI 创作视频的完整流程
1. 使用 ChatGPT 优化提示词
AI 创作的第一步不是直接生成视频,而是设计好的提示词(Prompt)。
普通描述:
一个女生坐在咖啡馆。
AI 很难理解具体画面。
优化后:
雨后的城市街角,一位年轻东方女性坐在咖啡馆窗边,等待一个没有出现的人,窗外霓虹灯倒映在玻璃上,她的眼神中充满期待、失落和温柔,电影级镜头,浅景深。
这样 AI 才能理解:
人物身份
场景环境
情绪表达
镜头语言
光影效果
在国内,也可以使用其他 AI 大模型辅助生成和优化提示词,不同模型对于提示词的理解方式有所不同,需要根据目标工具进行调整。
2. 使用可灵生成图片
完成提示词后,可以使用 可灵 AI 进行图片生成。
可灵不仅可以通过网页使用,也支持 AI 视频创作。
目前可灵采用自研 DiT(Diffusion Transformer)架构,通过 Transformer 结构替代传统卷积网络,并结合 Flow 模型作为扩散基础,提高模型的生成质量和计算效率。
简单来说:
传统 AI 更关注“画出图片”,而新一代模型开始理解:
场景关系
人物动作
镜头变化
视频连续性
让 AI 生成内容更加接近真实影视效果。
3. 可灵模型的发展
可灵模型自 2024 年 6 月发布 1.0 版本以来,持续快速迭代:
可灵 2.6
加入“原生音频”能力,可以同时生成:
画面
旁白
音效
环境声音
实现“音画同出”。
可灵 O1
定位为多模态统一模型,将:
文生视频
图生视频
视频编辑
融合到一个模型中,重点解决 AI 视频中的核心问题:
人物和场景的一致性。
可灵 3.0 / 3.0 Omni
进一步提升视频理解和生成能力。
通过统一架构,将:
内容理解
视频生成
视频编辑
整合为连续创作流程。
在:
角色一致性
指令理解
文字生成
视频长度
方面进一步提升。
三、从图片到视频
生成图片只是第一步。
真正的视频创作,需要进一步进行:
图片 → 动态视频
例如:
静态图片:
一个女孩站在雨后的街道。
转化为视频:
镜头缓慢推进,女孩看向远方,雨滴从玻璃滑落,街灯产生倒影,头发随微风轻轻移动。
这一步需要学习:
镜头运动
景别变化
转场设计
画面衔接
因为电影感并不是简单让图片动起来,而是让镜头拥有叙事能力。
四、AI 视频创作的本质
如今很多短视频平台中的 AI 内容,例如红果视频、抖音上的 AI 短片,本质流程都类似:
创意构思 → AI 优化提示词 → 生成图片 → 图片生成视频 → 剪辑包装
区别在于:
优秀作品往往拥有更好的:
Prompt 设计能力
剧情构思能力
镜头语言理解
AI 降低的是制作门槛,但真正决定作品质量的,依然是人的创造力。
未来,每个人都可能成为自己的导演。

评论