撰 文丨艾 杰
编 辑丨美 圻
过去两年,AI视频虽然迭代速度飞快,但生成模式都是一致的。用户输入提示词、提交任务、等待渲染,然后获得视频成片,行业最直观的进步,通常体现在画质、时长、人物一致性和声音同步上。
现在,这种大家习以为常的生产模式可能要发生变化了。不久前,X平台上冒出一个没有主播、没有节目单、也没有台本的直播间。上一秒还是六十年代风格的复古木偶广告,下一秒切到街头实景,再下一秒变成一只猫在弹钢琴,切换的依据,来自聊天框里某个观众随手敲的一行字。
这个“不寻常”的直播间很快就引发了网友关注,随后,博主@HoodyLiu拆解了这套“无限AI直播”的技术链路,基于MiniMax H3 Max,观众在评论区现场点播,人工智能当场制作,前一段画面还没播完,后一段视频已经生成完毕。
几乎同一时间,另一位博主@LerSentAI展示了如何用同样的超快生成速度,做出几乎无延迟的互动剧情游戏,而且同时支持真人与二次元Galgame风格。
两位博主的演示指向同一个变化:AI视频的生成速度正式超越了人类肉眼的播放速度,开始真正进入可交互、可循环、可预生成的阶段。这意味着,视频不再是“拍完再看”的成品,而是随叫随到、实时生长的内容流。从永不停播的直播间,到几乎零延迟的互动剧情游戏,我们可能正在见证AI视频从生成工具向实时交互媒介的关键性跃迁。

抹平时间差
AI视频的生产逻辑正在被改写
9月1日,MiniMax联合fal.ai正式发布H3 Max模型,官方表示生成一段5秒时长、768p分辨率的完整音视频,用时仅需3秒。不少博主在随后的测试中,都将用时压缩到了2.5秒之内。
这个时长让AI视频的生成速度第一次跑赢了播放速度,在此之前,主流AI视频产品的工作模式都是输入提示词、等待生成、播放结果,用户通常要等上几十秒甚至几分钟才能看到5到15秒的成片,生成内容是单向且固定的。

而当5秒视频只需不到3秒就能生成,意味着当前片段还在播放时,系统已经有充足的时间把下一段视频准备好,画面输出可以做到自始至终不中断。
HoodyLiu直播间搭建的核心逻辑,就是基于模型生成速度超过视频播放速度。当观众在评论区提出需求,系统几乎在几秒内返回新片段。由于上一段视频还在播放,新片段可以无感衔接,画面输出从开播起就未中断。对观众来说,这就像一个“永远有下一步”的直播间,点进去之后,内容总在继续,没有等待加载的断层。
这种实现方式之所以引发诸多关注,是因为它改变了直播的生产流程。传统直播无论真人还是虚拟人,本质上是在采集和传输一个已经存在的信号,观众互动需要通过主播或导播响应。

而HoodyLiu的直播间里,没有信号源,只有模型不断根据用户输入生成新内容。收集评论、判断指令、生成提示词、调用视频模型、完成审核和转码,再把结果插入直播流。只要下一段视频在当前片段播放完之前生成,直播就可以一直继续。
更重要的是,这种状态具有循环性。HoodyLi视频中分享了一个案例,另一位程序开发者用同一个底层模型做了一个类似短视频社交软件的应用程序,里面的所有内容同样由视频模型即时生成且平滑过渡。用户还在浏览当前视频时,下一段内容已经生成完毕,滑动屏幕即可无感切换;如果觉得短视频太短不够看,系统还能把画面延长至30秒。
这说明,实时生成不仅能在直播场景里成立,也可以在移动端短视频消费场景中运行。这个变化看似只是“快了几秒”,却改写了AI视频的生产逻辑。
一直以来,行业的生产模式都是预制内容,先写脚本、再拍摄、再剪辑、最后发布,整个链路按天甚至按周计算;今后有可能变成实时生长,观众的弹幕、玩家的选项、系统的随机事件,都可以直接驱动下一帧画面,内容在消费的同时被创造出来,中间的时间差被抹平了。

从无限直播到观众共创
交互式内容打开想象力边界
短视频平台的核心机制,是把内容消费切成一个个极短的片段。平台通过推荐系统预测用户可能喜欢什么,然后在用户滑动时快速提供下一条视频。这个流程已经足够成熟,但它本质上仍然依赖海量的预制内容库。
AI视频生成快过播放之后,信息流不一定还需要完全依靠既有库存。平台可以根据用户刚刚看过的内容、停留时间、点赞和跳过行为,实时生成下一段视频。
这会带来一种比“千人千面推荐”更进一步的形态:不是从内容库里给每个人推荐不同视频,而是为每个人生成不同的视频。

假设用户连续观看了一个赛博朋克城市的短片,系统可以根据其行为判断,他更偏好夜景、机械生物和追逐镜头,于是在下一段视频中继续保持这些元素,但换一条故事线。另一个用户看到同样的第一段内容,可能更喜欢安静的环境和人物对话,系统就会把下一段变成低节奏的室内剧情。两个人观看的不是同一部短剧,而是从同一个世界观出发、不断分化的个人版本。
技术上,这种产品需要将推荐系统、语言模型、视频模型和内容状态结合起来。推荐模型决定“用户可能想看什么”,语言模型负责把用户画像和剧情状态转化成生成指令,视频模型负责把指令变成可播放画面,而缓存系统则要提前生成最可能被观看的几个分支。
这与传统个性化推荐的区别在于,推荐系统不再只是一个排序器,而会成为内容生产的一部分。平台不只是决定把哪条视频放在用户面前,还决定下一条视频应该“发生什么”。
这种能力可能催生新的内容品类。互动短剧可以让观众在关键节点实时改变剧情走向,而无需等待重新生成;虚拟陪伴产品可以依据用户的实时情绪和对话内容,生成对应的动态画面回应;个性化直播综艺可以由观众投票决定接下来出现什么场景;AI原生社交游戏可以让玩家的每个动作都生成独一无二的过场动画。
这些方向并非遥不可及,LerSentAI展示的互动剧情游戏,就在直播之外进一步验证了实时交互的更多可行性。根据LerSentAI的演示,这套游戏能够根据玩家选择几乎无延迟地生成新的剧情画面,支持真人与二次元Galgame风格。玩家不再面对预设的静态分支,而是像在和一位实时反应的导演对话,每一步选择都会立刻得到新的视觉反馈。

目前,国外技术社区已经有不少开发者开始讨论“AI原生内容引擎”的概念。过去的视频引擎负责播放已编码的媒体流,而未来的内容引擎可能更像游戏引擎,实时计算、实时渲染、实时响应。区别在于,游戏引擎渲染的是预置的3D资产和动画,而AI引擎生成的是动态的、不重复的视频帧。这个转变一旦完成,内容产品的基础架构都会随之改变。

速度只是起点
实时AI大规模落地仍有多重挑战
生成速度跑赢播放速度,解决了实时性这个最大的障碍,但并不意味着实时AI内容已经可以大规模落地,质量、一致性、成本、安全性等诸多问题都有待解决。
在X平台和reddit社区,AI价值官看到不少开发者吐槽,实时生成意味着难以进行人工审核,用户输入的提示词可能触发暴力、色情等违规内容,内容安全需要自动化方案介入。如何在多模态视频帧推向客户端的瞬间完成精准、高效的合规过滤与安全风控,避免不可控的生成事故,是摆在所有平台运营者面前的红线难题。
同时,一致性问题也是当前的一大挑战。连续生成对角色一致性、场景连续性的要求远高于单个视频片段,任何一点跳变都会破坏沉浸感。但扩散模型天生缺乏长期记忆,每一段素材几乎独立生成,哪怕提示词完全一致,采样噪声不同也会导致画面偏差,超过一定时长后角色外貌、场景逻辑容易崩塌。

从目前网上的演示结果看,虽然能够做到片段间的平滑切换,但经历数分钟的连续互动后,角色的五官特征、服装细节、光源方向以及空间拓扑结构往往会不可避免发生形变与漂移,显得力不从心。
成本问题同样不可忽视,虽然H3 Max被MiniMax官方称为针对实时交互场景优化,但持续运行一个直播间,意味着长期占用算力资源。观众每一次点播、每一次滑动,都会触发新的生成请求,这对成本是很大的考验。
在相关开源项目的讨论中,有开发者提到,持续生成对GPU资源的消耗相当大,商业上能否跑通,取决于单位互动成本能否降到足够低。如果生成一段5秒视频的成本无法被平台收入覆盖,那么无限直播就只能停留在技术演示阶段。
这些挑战意味着,实时交互AI内容的大规模落地和商业化不可能一蹴而就,但一个新的内容阶段已经开启。因为底层都变成了同一个实时生成引擎,未来观众不再是单一的观看者,而是共同创作者,直播、短视频、游戏、社交的边界会变得模糊。毫无疑问,这些变化将对今后的内容生态产生深远影响。
本文来自投稿,不代表增长黑客立场,如若转载,请注明出处:https://www.growthhk.cn/quan/169133.html
微信扫一扫
支付宝扫一扫