一句话回答:AI 视频生成是模型根据文字、图片、视频、音频或动作参考,合成新的连续画面,并在部分系统中同时生成对白、环境声和音乐。它不是把一张图简单“动起来”,而是要同时维持人物、物体、镜头、动作、时间和声音的一致性。

对普通用户,最有效的起点不是先比较模型名,而是明确自己要生成“一个镜头、一个分镜草案,还是可以直接交付的完整视频”。镜头草案可以容忍局部漂移,商业交付则还要核对人物连续性、字幕和声音、素材授权、平台标识、导出规格与返工成本。本文会按这条决策顺序展开,避免把演示效果误当成稳定生产能力。
AI 视频生成包含哪些任务?
| 任务 | 主要输入 | 适合解决的问题 | 常见失败点 |
|---|---|---|---|
| 文生视频 | 文字提示 | 从概念快速生成镜头草案 | 人物和动作难以精确复现 |
| 图生视频 | 首帧或参考图 | 保持主体外观并增加运动 | 脸部、手部或背景发生漂移 |
| 参考生视频 | 图像、视频、音频等组合 | 参考构图、动作、节奏或声音 | 不同参考之间相互冲突 |
| 视频编辑 | 已有视频与修改指令 | 替换局部、延长镜头、改风格 | 改动区域与原画面不连续 |
| 音画联合生成 | 提示或多模态参考 | 同步产生画面、对白和环境声 | 口型、语义和声音节奏错位 |
不同产品支持的输入、时长、分辨率、声音、地区和套餐并不相同。Google DeepMind 的Veo 3.1 Lite 模型卡明确列出文字或图片输入以及带音频的视频输出;字节 Seed 的Seedance 2.0 发布说明则列出文字、图片、视频和音频的混合参考能力。这些是具体产品能力,不应外推为所有视频模型都具备。
怎么按需求选择 AI 视频工具?
先把任务写成“输入—控制—输出—限制”,再去看产品是否支持,不要先看排行榜。产品能力和可用地区会变化,下面的判断依据是截至 2026 年 7 月 19 日可查的官方资料;正式采购前仍需用自己的提示、素材和账号区域复测。
| 真实需求 | 优先核对的能力 | 可查的一手资料 | 不能仅凭宣传确认的事 |
|---|---|---|---|
| 文字快速做分镜 | 文字输入、镜头时长、比例、批量变体 | 具体模型卡和产品帮助文档 | 中文提示的平均一次通过率 |
| 让现有图片动起来 | 图生视频、首尾帧、运动与镜头控制 | Runway 图生视频提示指南说明参考图决定构图、主体、光线和风格,文字主要描述运动与时间变化 | 换一张输入图后仍能保持相同成功率 |
| 同时生成对白和环境声 | 原生音频输出、语言、口型与说话人一致性 | Veo 模型卡、Seedance 发布说明 | 所有口音、多人对话和复杂动作都能同步 |
| 品牌或商业项目 | 输入数据处理、商用条款、输出归属、内容凭证 | Runway 服务条款可作为条款核对示例;实际项目还要检查所选服务商的当期协议 | 输出必然唯一、绝不近似第三方作品或自动获得商标权 |
| 在已有视频上修改 | 视频输入、局部编辑、延长、参考保持 | 产品针对该编辑模式的帮助页 | 生成模型具备视频功能就一定支持无损局部编辑 |
如果只是测试概念,先选能导出短镜头、保存原始输出和复现参数的工具;如果进入团队生产,则把权限、素材留存、审核、费用上限和撤回能力放在画质之前。Runway 产品能力页可作为“先核对当前产品模式和控制能力”的实例,但它只代表该产品当期公开能力,不是行业统一操作方式。
为什么旧横评很快失效?
视频工具的产品名称、模型版本、入口、地区和套餐经常一起变化,旧文章中的“最好”“免费”“支持某时长”不能直接沿用。一个典型例子是 OpenAI 的旧 Sora 产品发布页现在已明确标注该产品自 2026 年 4 月 26 日起不再提供;因此,仍把旧 Sora 套餐、分辨率或功能写成当前购买建议的横评已经失去决策价值。遇到类似页面,应区分历史产品、当前模型和实际可用入口,并以账号内可见能力及当日官方说明为准。
开工前怎样写一份可验收的项目合同?
“做一条高级感宣传片”无法指导生成,也无法判定交付。无论个人创作还是团队生产,都应先把用途、镜头、素材、权利、技术规格和批准人写成一页项目合同。这个合同不是法律合同,而是所有参与者共同使用的制作与验收基线。
| 字段 | 必须写清的内容 | 可验收写法 | 不能接受的写法 |
|---|---|---|---|
| 用途与受众 | 发布平台、地区、是否投放、受众年龄 | 用于品牌官网的 15 秒产品概念片,不冒充实拍 | 做一个爆款视频 |
| 镜头与叙事 | 镜头数量、每镜主要事件、首尾状态 | 4 个镜头,每镜只包含一个关键动作 | 把整篇脚本一次生成 |
| 固定元素 | 人物、服装、产品、色彩、字体与禁用项 | 产品外形和包装文字不得变化 | 整体保持一致即可 |
| 输出规格 | 比例、尺寸、帧率、编码、声音、字幕安全区 | 9:16,1080×1920,H.264,字幕不进入底部交互区 | 高清竖屏 |
| 权利与披露 | 素材来源、肖像/声音授权、AI 标识和平台字段 | 每个输入资产均有编号和使用范围,发布时勾选合成内容 | 网上素材应该都能用 |
| 批准与停止 | 逐镜批准人、阻断缺陷、费用和重试上限 | 身份漂移、错误文字或无授权元素立即停止 | 多生成几次直到满意 |
合同还应写明“什么不由 AI 证明”:产品效果、新闻事件、真人言论和安全性能都需要独立证据。生成画面只能作为表达方式,不能反过来成为事实来源。涉及智能体自动生成、审批和发布时,可继续参考AI 智能体原理与治理指南设置权限与人工控制点。
怎样保存一张能复现的生成记录卡?
每个候选镜头应有唯一编号,并关联输入文件哈希、提示原文、参考顺序、产品与模型名称、模式、比例、时长、分辨率、种子或平台可用的复现字段、生成时间、账号区域、套餐、扣费、原始输出文件和操作者。不要只保存最后下载的视频,因为模型或产品界面更新后,团队将无法解释它是怎样产生的,也无法确认是否使用了错误素材。
评审记录还要把“喜欢”和“通过”分开:喜欢是审美判断,通过必须对应项目合同中的身份、动作、文字、声音、权利和平台规格。每次修复都建立新版本,并记录它替换了哪个镜头、修复了什么缺陷、谁批准、哪些问题被接受。高风险项目的记录访问权限、保留期限和删除方式可结合AI 安全与数据治理指南设计;提示、参考图和视频截图本身也可能包含个人或商业敏感信息。
同一镜头需要横版、竖版和方形版本时,不要只把成片居中裁切。不同画幅会改变主体位置、运动路径、字幕安全区和镜头速度;应在项目合同中分别定义构图与验收,并保留各自的原始输出。若平台会再次压缩或自动裁剪,还要上传测试稿检查文字、细节、响度和封面,而不是用本地播放器的效果代替真实发布验收。
它大致怎样工作?
多数现代系统会先把提示与参考素材编码为模型可处理的表示,再在压缩的视频表示或像素空间中逐步生成时空内容,最后解码、增强并合成声音。公开系统可能采用扩散、Transformer、多模态联合生成或其他组合架构;厂商未公开的内部组件不能根据宣传页面反推。
- 理解输入:识别人物、场景、动作、镜头、风格、时长和禁止事项,并处理图片、视频、声音等参考。
- 规划时间:决定物体在前后帧如何变化,镜头何时移动,多个动作怎样衔接。
- 生成视觉:产生主体、背景、光照和运动;模型需要在变化中保持身份与几何关系。
- 生成或对齐声音:部分系统同步生成对白、音乐与环境声,其他系统仍需要后期配音。
- 解码与安全处理:输出可播放文件,并执行内容过滤、水印、来源标记或平台规定的处理。
旧稿把“扩散模型 + 时空注意力 + 3D VAE + DiT”写成 2026 年统一标准并不准确。这些是常见技术路线中的组件,而不是每个系统都必须采用、也不是用户仅凭成片就能确认的内部事实。
真正难点不是清晰度,而是可控性
- 主体一致性:人物衣着、脸、道具和环境在镜头变化后仍需保持。
- 运动与物理:接触、遮挡、重量、碰撞、液体和多人交互容易出现不自然结果。
- 镜头服从:景别、机位、运镜速度、焦点和剪辑节奏需要可重复控制。
- 文字与标识:招牌、包装、字幕和品牌字样可能变形,商业交付前必须逐帧检查。
- 声音同步:口型、说话人、空间位置、环境声与画面事件要在时间上对应。
- 长时一致性:镜头越长、角色越多、事件越复杂,错误累积通常越明显。
厂商展示片只能证明模型能产出某些优质样本,不能代表任意提示的平均成功率。即使官方提供胜率或内部基准,也要核对提示集、对手版本、评审方式和样本量。例如 2026 年 4 月发布的 Veo 3.1 Lite 模型卡披露:相对 Veo 3.1 Fast,文生视频在 1000 条提示上的总体胜率为 54.6%,图生视频在 646 条提示上为 47.2%。这只能说明该模型卡定义的比较,不能外推为对所有产品、任务或中文提示都领先。
镜头提示和验收标准怎么写?
可执行的镜头说明不是形容词堆砌,而是把可观察的结果写出来。图生视频时,参考图通常已经提供人物外观、构图、光线和风格,提示词应把主要篇幅留给动作、运镜和时间变化。Runway 的官方指南同样建议用清晰直接的语言描述“画面中要发生什么”,并提醒简单提示可能比互相冲突的长提示更有效。
| 字段 | 写法示例 | 验收问题 | 常见错误 |
|---|---|---|---|
| 主体与不可变元素 | 同一位穿蓝色外套的人,右手拿白杯 | 服装、脸、道具是否全程保持 | 每句换一种人物称呼或新增冲突细节 |
| 主要动作 | 向左走三步,停下,把杯子放在桌面 | 动作顺序、接触与结束状态是否正确 | 一镜同时要求十多个事件 |
| 镜头 | 中景,固定机位,结尾缓慢推近 | 景别和运镜是否按时发生 | 同时要求固定机位、环绕和快速剪辑 |
| 时间与节奏 | 前 2 秒行走,中间停顿,末 2 秒推近 | 事件是否落在指定时间段 | 只写“电影感、丝滑、高级” |
| 声音 | 环境声为轻微雨声;一位说话人读指定句子 | 音源、口型、语义和事件是否对齐 | 未确认模型是否支持原生声音 |
| 禁止与边界 | 不要在成片依赖否定词,改写为明确正向状态 | 产品是否支持负面提示或控制字段 | 把不支持的控制当成一定有效 |
从想法到可交付视频的八步流程
- 定义用途:先确定是分镜草案、社交短片、广告素材还是正式成片,并写明平台规格。
- 拆成短镜头:一个镜头只表达一个主要动作;复杂剧情先做镜头表,不把整段故事塞进一条提示。
- 准备已授权素材:记录人物肖像、音乐、字体、商标和参考视频的来源与使用范围。
- 固定不可变元素:为人物、服装、场景、色彩和镜头语言建立参考包,减少每轮描述漂移。
- 先低成本试样:用较短时长或较低规格测试构图与动作,确认方向后再生成高质量版本。
- 逐镜验收:检查首尾帧、脸手、道具、文字、遮挡、口型、音量和突然闪烁。
- 人工剪辑与修复:选择可用片段,补字幕、调色、混音并替换错误帧;生成不等于自动交付。
- 保存证据与版本:保留提示、输入素材、生成时间、产品版本、编辑步骤和最终批准人。
如何评测一款视频生成工具?
不要只比较官网样片。建立一组固定提示,覆盖单人、多主体、快速运动、镜头切换、画面文字、中文对白和失败边界;同一产品记录日期、模型、模式、套餐、种子或参考素材。至少统计:
- 一次生成可直接使用的镜头比例,而不是只展示最佳样本;
- 主体一致性、动作完成度、提示遵循和声音同步的人工评分;
- 每个可用镜头的总生成次数、等待时间和实际费用;
- 失败类型及其可修复性,例如重生成、局部编辑或必须重拍;
- 商用条款、输出归属、训练选项、数据保留和内容凭证支持。
一个可复现的最小测试可以使用 12 条固定任务,每条生成 3 次,共 36 个样本。先写清“可用”的判定条件,再计算一次通过率:通过样本数÷总样本数;同时单列必须人工修复和完全不可用的数量。测试记录至少保存提示、输入素材哈希、模型/模式、生成时间、原始输出、评审人和失败标签。样本少时只报告本次测试结果,不把它包装成全行业排名。
| 缺陷级别 | 例子 | 处理 | 是否可进入发布 |
|---|---|---|---|
| 阻断 | 无授权真人肖像、伪造事实、关键商标错误、违规内容 | 停止使用并升级给负责人 | 否 |
| 严重 | 身份漂移、动作逻辑错误、口型错位、画面文字错误 | 重生成、局部修复或重拍,并重新验收 | 修复前否 |
| 一般 | 轻微闪烁、非关键背景变形、可剪掉的首尾异常 | 记录后剪辑或修复 | 由场景标准决定 |
| 提示 | 不影响含义的小幅风格偏差 | 记录接受理由 | 可,但需批准 |
看到缺陷后,应该改提示、改参考还是换路线?
无目标地重复生成会同时放大费用和挑选成本。先按缺陷发生的位置判断:如果首帧就错,通常应修正参考素材或固定元素;如果动作顺序错,先缩短镜头并减少事件;如果主体中途漂移,拆镜、使用参考控制或在后期剪辑点切换;如果文字和商标错误,不要把关键文字交给视频模型,改为后期叠加;如果口型和对白不稳定,先把画面与声音拆开生产,再用配音或口型工具单独验收。

| 现象 | 先检查 | 优先动作 | 停止条件 |
|---|---|---|---|
| 第一帧人物或产品就不对 | 参考图质量、裁切、遮挡与冲突描述 | 清理参考图,减少互相竞争的属性 | 关键产品外形无法稳定保持 |
| 动作顺序混乱或物体穿透 | 一个镜头是否塞入过多事件 | 拆为短镜头,明确起始与结束状态 | 高风险动作可能产生误导 |
| 人物中途换脸、服装漂移 | 参考模式、镜头长度、多主体交互 | 减少角色,使用连续参考,在剪辑点换镜 | 真人身份被错误呈现 |
| 包装字、字幕或商标变形 | 文字是否必须由模型生成 | 生成无字底片,后期叠加已批准文字 | 错误文字影响价格、规格或品牌 |
| 对白、口型或环境声错位 | 产品是否真正支持该语言和多人声音 | 拆分画面、对白、音效并分别验收 | 内容含义或说话人被改变 |
| 出现未经授权人物或受保护元素 | 输入来源、提示、近似角色与输出帧 | 立即隔离输出,替换素材并升级审核 | 无法证明权利或存在人格伤害风险 |
若用于团队采购,可参考AI 工具箱建立相同样本的横向测试;需要把生成、审批和回滚连接成流程时,可参照AI 智能体与自动化治理指南。
成本应该按什么口径计算?
单次生成价格不能代表生产成本。更实用的指标是“每个最终可用镜头的完全成本”:把生成费、失败重试、素材授权、人工提示与挑选、剪辑修复、配音字幕、审核和平台适配全部相加,再除以通过验收的镜头数或成片秒数。产品按积分、秒数、分辨率或套餐计费时,先换算成同一口径。
| 成本项 | 记录方式 | 容易漏掉的部分 | 优化方法 |
|---|---|---|---|
| 模型生成 | 每次模式、时长、规格和扣费 | 失败样本和排队取消仍可能消耗额度 | 低规格试样通过后再升规格 |
| 人工时间 | 提示、等待、挑选、复核和沟通分钟数 | 多人反复审片与版本确认 | 预先写验收表和阻断标准 |
| 素材与权利 | 图片、字体、音乐、肖像和声音授权 | 地域、期限、媒体和再授权范围 | 建立可复用且权利清楚的素材库 |
| 后期与修复 | 剪辑、抠像、调色、字幕、混音和重拍 | 模型错误导致的逐帧修复 | 关键文字与精确产品展示改由后期完成 |
| 风险与返工 | 下线、替换、投诉处理和重新发布 | 误导、侵权或未披露造成的整片作废 | 在生成前完成授权和披露判断 |
同时报告一次通过率和人工接管率:低价模型如果需要大量重试和修复,完全成本可能更高。没有真实生成日志时,不应写“效率提升几倍”或“成本下降多少”;本站也不会把厂商展示片当成自己的实测。需要设计采购试验时,可参考AI 可用性测试与验收方法,用同一任务集记录成功、失败和人工负担。
版权、肖像与内容真实性怎么处理?
生成前要确认输入素材和人物授权,生成后要检查成片是否模仿受保护角色、包含商标、虚构真人行为或产生未经同意的亲密内容。不同地区和平台规则不同,不能把“工具允许生成”等同于“可以公开商用”。
NIST 合成内容透明度报告总结了来源追踪、标记、水印、检测和审计等技术路径,也指出这些机制仍有局限。C2PA Content Credentials可用加密绑定的清单记录资产来源、修改和 AI 使用信息,但内容凭证证明的是记录和完整性,不自动证明画面中的事件真实。
中国网信办等四部门发布的《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日施行,区分用户可感知的显式标识和文件元数据中的隐式标识,并规定了相关服务提供者和发布用户在适用情形下的标识要求。具体责任仍要按你的角色、服务方式和适用法域判断,本文不替代法律意见。
平台规则也要单独检查。YouTube 的合成或重大修改内容披露规则要求创作者对看似真实且经过实质修改或合成的内容进行披露,例如让真人说出未说过的话、改变真实事件画面或生成并未发生的写实场景;纯幻想内容和轻微美化并不一概要求披露。披露本身不等于内容一定合规,也不自动保证商业化资格;YouTube 的频道获利政策还会审查批量、重复或缺乏真实新增价值的内容。

发布前最后检查什么?
| 检查项 | 最低证据 | 不通过时怎么做 |
|---|---|---|
| 输入权利 | 素材来源、授权对象、用途、地区和期限 | 替换素材或补齐授权,不凭“网上能下载”放行 |
| 人物与事实 | 肖像/声音同意、事实来源、不得误导的上下文 | 删除、重做或增加清晰说明;写实画面不得冒充现场记录 |
| 逐镜质量 | 通过记录、缺陷标签、批准人 | 按阻断/严重/一般级别返工 |
| AI 标识 | 适用规则判断、画面或说明中的显式标识、文件元数据 | 补标并重新导出;不得恶意删除所需标识 |
| 平台字段 | 上传时的 AI/合成内容声明截图或日志 | 补填平台字段,敏感主题加更显著上下文 |
| 来源与修改 | 原始输出、剪辑工程、导出文件哈希;可选 C2PA 凭证 | 重建可审计归档;不能把无凭证说成“已认证真实” |
| 撤回与纠错 | 负责人、版本号、下线和替换路径 | 未建立责任人前不发布高风险内容 |
Content Credentials 官方说明展示了来源与编辑历史信息如何随数字内容一起呈现;YouTube 也说明被合成人物可依据其隐私与身份保护流程提出移除请求。团队应同时保留“谁有权使用素材”和“文件经历了哪些操作”两类证据。更多内容生产流程可参考AI 教程与工作流,事实核验方法可参考AI 回答证据核验指南。
常见问题
AI 视频可以直接替代拍摄吗?
适合概念验证、分镜、无法实拍的视觉和部分短内容;涉及真实产品效果、新闻事实、人物代言和精确动作时,仍需实拍证据或严格人工复核。
提示词越长越好吗?
不一定。互相冲突的角色、镜头和动作会降低服从度。优先写清主体、动作、环境、镜头和限制,再通过参考素材与分镜逐步控制。
有水印就能证明视频是假的吗?
不能。水印可能被裁剪或丢失,真实视频也可能没有内容凭证。来源判断需要结合文件凭证、发布主体、原始素材和外部事实。
怎样计算真正成本?
按“最终可用秒数”核算生成费、失败重试、素材授权、人工剪辑、配音、审核和平台适配,而不是只看单次生成价格。
图生视频为什么会把原图缺陷放大?
参考图不仅提供主体,也提供构图、光线和纹理。模糊的手、遮挡的脸、错误文字或不合理透视可能在运动中继续扩散。先修复首帧并确认关键元素,再描述动作和运镜,通常比在长提示中反复纠错更可控。
可以把生成视频当作产品演示证据吗?
不能。生成画面可以表达概念,但不能证明产品真实尺寸、性能、使用效果或事件发生。涉及购买、安全、医疗、金融或新闻判断时,必须使用真实拍摄、测试记录或可核验文件,并清楚标明概念演示。
编辑复核与纠错记录
本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日复核。旧稿把特定架构写成全行业统一路线,并用“高保真、全场景、全面进化”等措辞替代可验收标准;本次发布前 A 级升级区分通用原理与具体产品能力,补充旧产品与当前入口核验、项目合同、官方模型卡的样本量边界、工具选择矩阵、镜头说明模板、缺陷定位与停止路线、完全成本、可复现测试、授权证据链、中国生成合成内容标识要求和平台披露边界。文章正式发布后还需重新读取远端指纹,并完成桌面端、移动端和慢速网络验收,才能获得最终 A 级认证。本站的更新与纠错方法见关于本站与编辑规范。
