PixVerse R2 是什么
PixVerse R2 是爱诗科技(AIsphere)于 2026 年 8 月下旬发布的实时全模态世界模型,是此前业内首个实时视频世界模型 PixVerse R1 的进化版本。如果说 R1 证明了”视频生成可以从一次付的固定片段,变成持续运行、实时响应的动态世界”,那么 R2 要回答的就是这个范式如何持续扩展:让模型在更长的时间尺度下保持统一的世界状态,同时理解文字、参考内容、音频与动作等多模态输入,让用户的每一次操作都能持续影响后续的场景、角色与故事发展,并同步输出高质量的音视频流。

爱诗科技成立于 2023 年 4 月,创始人王长虎来自字节跳动 AI Lab,其旗下 PixVerse 系列产品全球用户已突破 4000 万。R2 的发布标志着实时世界模型从”可行性验证”正式进入”可扩展、可迭代”的新阶段。
PixVerse R2 的核心技术架构
PixVerse R2 将整体框架收敛为两个核心层次:Omni Causal AR(全模态因果自回归)与 Real-Time Acceleration(实时加速层)。前者通过持续预训练不断扩大世界生成的能力上限,把文本、参考图、音频与动作信号中的物理因果持续内化进同一个模型;后者则在严格的交互延迟约束下,把这份能力尽可能无损地蒸馏加速到实时、可交互的运行区间。相比传统”多阶段串联训练”的管线,这种统一训练范式大幅减少了能力迁移带来的折损。
- Dynamic Chunk 动态分块:根据控制信号的语义边界自适应切分音视频序列——短 Chunk 提升动作指令的响应精度,长 Chunk 保留与音视频语义的完整结构,让不同输入共享同一套因果生成接口。
- 多时间尺度记忆:由 Sink Memory(保存角色、场景、世界规则等长期锚点)、Rolling History(衔接近期动作与镜头变化)和 Object KV Cache(复用对象级历史表征)组成,在有限计算预算内同时保持世界身份与近期动态,显著降低角色漂移与场景突变。
- Error Bank 误差库:把有代表性的错误历史状态沉淀为可复用样本,在训练中按比例回放,让模型主动学会识别并修复偏差历史。阶段评测中,长期亮度漂移指标从 0.201 降至 0.129,改善约 35.8%。
- 块稀疏注意力与金字塔蒸馏:注意力稀疏度提升至 90% 以上,配合粗到细的金字塔生成路径,在保持画质的前提下大幅压缩计算成本,支撑复杂场景下的实时运行。
PixVerse R2 的主要功能
- 全模态交互生成:统一接收文本提示、多模态参考内容、Action 操控信号(如 WASD 按键或连续控制信号)与音频输入,输出同步的音视频流,实现”所想即所得”的实时交互反馈。
- 边生成边演化:控制信号可以在运行过程中持续进入模型并改变后续世界状态,模型不只是响应一次性条件,而是边生成、边接收控制、边更新世界。
- 长程一致性保持:多时间尺度记忆与误差库共同构成训练闭环,让画面、角色、音画关系与控制响应在长时间运行中保持稳定,有效规避状态漂移。
- 自适应生成粒度:系统根据输入信号的语义复杂程度智能调整音视频的生成粒度,在响应速度与内容细节之间取得平衡。
- 高效实时推理:通过实时加速层的对抗正则蒸馏与稀疏注意力优化,将完整世界建模能力压缩进低延迟、可交互的推理区间。
如何使用 PixVerse R2
- 申请内测:PixVerse R2 目前处于封闭内测阶段,用户可通过官方发布的世界模型 R2 体验表提交申请,获取早期体验与 API 接入权限。
- 选择使用方式:获批后既可以在官方界面直接体验实时世界生成与交互,也可以通过 API 将模型能力集成到自建的游戏、直播或仿真应用中。
- 先用已有产品过渡:在等待内测期间,创作者可以先用 PixVerse 现有的视频生成产品(如 V6 与 R1)熟悉世界模型范式的交互逻辑。

PixVerse R2 的使用场景
- 交互式娱乐与游戏:玩家通过键盘或语音指令直接干预虚拟世界,模型即时生成高度响应的游戏体验,类似 Kage 这类实时 3D 交互体验所代表的”可玩世界”方向。
- 影视创作预演:导演即时调整分镜与场景,在拍摄前期完成叙事节奏的精准验证,大幅精简制作周期。
- 互动式直播:数字人实时处理观众反馈,根据指令动态切换场景与动作,实现人机实时共创。
- 仿真与培训:在驾驶教学、医疗演练等领域提供低成本、的模拟环境,提升训练的沉浸感与灵活性。
PixVerse R2 与同类世界模型的对比
相较于市面上其他实时世界模型产品(如昆仑万维的 Matrix-Game 3.0),PixVerse R2 的优势集中在架构统一性与多模态融合上:全模态因果自回归与实时加速层的深度整合,让它在长程一致性与实时交互准确度上表现更突出;特别是通过误差库主动修复亮度漂移与错误的做法,把长期漂移从”部署时被动承受”变成”训练时主动优化”,展现出较高的工业级稳定性。需要说明的是,它与 Qwen3.8-Flash 这类通用多模态理解模型定位并不相同——后者擅长”看懂”内容,而 R2 专注”演活”一个可交互、可持续演化的时空世界。官方也坦承,在严格的实时算力与延迟预算下,R2 当前单次生成的画质与领先的离线视频模型(如 Gemini Omni 1.1 Flash 这类新一代视频生成模型)相比仍有差距,这更多反映其当前所处的扩展阶段而非框架上限。
PixVerse R2 的常见问题解答
- PixVerse R2 现在可以公开使用吗?
- 目前处于封闭内测阶段,尚未公开提供服务。开发者与创作者可以通过官方体验表提交申请,获取早期体验与 API 接入权限;正式开放时间以官方公告为准。
- PixVerse R2 与 R1 的区别是什么?
- R1 提出并验证了实时视频世界模型的技术范式;R2 则解决该范式如何持续扩展——通过统一的 Omni Causal AR 架构与实时加速层,让模型在更长的时间尺度下保持世界状态,并支持更丰富的多模态输入与更稳定的长期运行。
- PixVerse R2 支持哪些输入方式?
- 支持文本提示、多模态参考内容、音频以及动作操控信号(如 WASD 按键或连续控制信号)四类输入,模型在运行过程中可持续接收这些信号并实时更新世界状态,输出同步的音视频流。
PixVerse R2 官网网址
PixVerse R2 技术报告:https://pixverse.blog/en/blog/pixverse-r2-scaling-real-time-omni-world-models
PixVerse 官网(内测申请入口):https://www.pixverse.ai/
OpenI AI时代点评
世界模型赛道正在从”能生成”走向”能持续运行”。PixVerse R2 最有价值的不是某项单点指标,而是它把多阶段训练管线收敛为两条可持续扩展的主线:一边不断扩大世界建模的能力上限,一边把这份能力稳定加速到实时交互区间。多时间尺度记忆与误差库的设计尤其务实——它直面了自回归模型长期运行必然出现的漂移问题,并给出了可验证的解法。
对内容行业而言,实时世界模型意味着”视频”和”游戏”的边界将被重新定义:导演可以即时刻画场景,玩家可以语音改写世界,直播观众可以参与叙事走向。目前 R2 仍在内测,单次生成画质也还有追赶空间,但方向已经清晰——如果说 R1 让实时世界模型成立,R2 则让它第一次看起来可以规模化。值得开发者持续关注。


