text-to-video
概念词 📚 基础词库 · 存量热词文生视频
🔍 Google 联想 10 📄 arxiv 1424 篇 📅 首次出现 2026-08-28
🧠 text-to-video 是什么
文生视频(text-to-video)指输入自然语言描述,由生成模型输出与之对应的连续视频。早期工作如 2022 年的《Video Diffusion Models》把扩散模型扩展到时空维度,但生成内容时长短、分辨率低、一致性差。
2024 年 OpenAI 发布 Sora,凭借较长的时长、相对稳定的物理表现与多镜头叙事引爆全球关注;国内快手可灵、字节跳动即梦等产品随后跟进,文生视频进入"分钟级、电影质感"的竞争阶段,后续迭代进一步聚焦运镜控制与角色一致性。
当前主流技术路线以扩散模型与 DiT(Diffusion Transformer)为主,同时探索图像、音频、视频联合生成;版权归属、内容审核与深度伪造标识是伴随的治理难题。
🔥 为什么现在火
短视频与影视内容产业急需低成本素材生产工具,文生视频直接改写内容生产链条;Sora 等产品让"人人可拍电影"成为现实,也把虚假视频治理推向公共议题。
📄 证据链(交叉验证)
🔍 搜索形态
what is text-to-video text to video AI meaning
text-to-video 常见问题 FAQ
文生视频和文生图有什么不同?+
视频需要同时建模时间维度的连续性与物体运动一致性,生成难度和计算成本远高于静态图像。
文生视频可以商用吗?+
可以,主流产品均已开放商用,但内容版权、平台审核与合成标识等合规要求仍在完善中。
与 text-to-video 相关的搜索
人们搜索 text-to-video 时,还会关心这些问题:
- 文生视频 是什么
- 什么是 文生视频
- 文生视频 是什么意思
- 文生视频 原理
- 文生视频 有什么用
- 文生视频 应用场景
- 文生视频 为什么火
- 文生视频 2026