← 返回首页

从一句 Prompt 到一部视频:AI 视频创作入门

📝 _

一、AI 视频的发展

过去,视频制作需要摄影、演员、场景搭建、后期剪辑等多个环节,一个普通人很难独立完成。

随着生成式人工智能的发展,视频创作正在发生改变。从最初的 AI 图片生成,到现在的 AI 视频生成,人工智能已经能够理解文字描述,并将创意转化为具有镜头感的视频内容。

目前主流的 AI 视频生成方式主要是:

文字描述(Prompt) → AI 生成图片 → 图片转视频 → 后期剪辑

这种方式已经成为很多 AI 短视频创作者常用的制作流程。


二、使用 AI 创作视频的完整流程

1. 使用 ChatGPT 优化提示词

AI 创作的第一步不是直接生成视频,而是设计好的提示词(Prompt)。

普通描述:

一个女生坐在咖啡馆。

AI 很难理解具体画面。

优化后:

雨后的城市街角,一位年轻东方女性坐在咖啡馆窗边,等待一个没有出现的人,窗外霓虹灯倒映在玻璃上,她的眼神中充满期待、失落和温柔,电影级镜头,浅景深。

这样 AI 才能理解:

  • 人物身份

  • 场景环境

  • 情绪表达

  • 镜头语言

  • 光影效果

在国内,也可以使用其他 AI 大模型辅助生成和优化提示词,不同模型对于提示词的理解方式有所不同,需要根据目标工具进行调整。


2. 使用可灵生成图片

完成提示词后,可以使用 可灵 AI 进行图片生成。

可灵不仅可以通过网页使用,也支持 AI 视频创作。

目前可灵采用自研 DiT(Diffusion Transformer)架构,通过 Transformer 结构替代传统卷积网络,并结合 Flow 模型作为扩散基础,提高模型的生成质量和计算效率。

简单来说:

传统 AI 更关注“画出图片”,而新一代模型开始理解:

  • 场景关系

  • 人物动作

  • 镜头变化

  • 视频连续性

让 AI 生成内容更加接近真实影视效果。


3. 可灵模型的发展

可灵模型自 2024 年 6 月发布 1.0 版本以来,持续快速迭代:

可灵 2.6

加入“原生音频”能力,可以同时生成:

  • 画面

  • 旁白

  • 音效

  • 环境声音

实现“音画同出”。


可灵 O1

定位为多模态统一模型,将:

  • 文生视频

  • 图生视频

  • 视频编辑

融合到一个模型中,重点解决 AI 视频中的核心问题:

人物和场景的一致性。


可灵 3.0 / 3.0 Omni

进一步提升视频理解和生成能力。

通过统一架构,将:

  • 内容理解

  • 视频生成

  • 视频编辑

整合为连续创作流程。

在:

  • 角色一致性

  • 指令理解

  • 文字生成

  • 视频长度

方面进一步提升。


三、从图片到视频

生成图片只是第一步。

真正的视频创作,需要进一步进行:

图片 → 动态视频

例如:

静态图片:

一个女孩站在雨后的街道。

转化为视频:

镜头缓慢推进,女孩看向远方,雨滴从玻璃滑落,街灯产生倒影,头发随微风轻轻移动。

这一步需要学习:

  • 镜头运动

  • 景别变化

  • 转场设计

  • 画面衔接

因为电影感并不是简单让图片动起来,而是让镜头拥有叙事能力。


四、AI 视频创作的本质

如今很多短视频平台中的 AI 内容,例如红果视频、抖音上的 AI 短片,本质流程都类似:

创意构思 → AI 优化提示词 → 生成图片 → 图片生成视频 → 剪辑包装

区别在于:

优秀作品往往拥有更好的:

  • Prompt 设计能力

  • 剧情构思能力

  • 镜头语言理解

AI 降低的是制作门槛,但真正决定作品质量的,依然是人的创造力。

未来,每个人都可能成为自己的导演。屏幕快照 2026-07-16 的 10.17.37 上午.png屏幕快照 2026-07-16 的 10.07.04 上午.png


评论