Vivix

Vivix – Vivix推出的首个实时交互多模态基座模型

Vivix,这家由前商汤高管刘宇倾力打造的AI新锐企业,隆重推出了其划时代的创新成果——全球首批实时交互多模态基座模型:Vivix-A1与Vivix-W1。这两款模型均采用了约300亿激活参数的统一流式架构,巧妙地将多模态参考、原生交互与流式视频生成集于一体,赋予用户前所未有的能力,可以通过语音、文字、触控等多种方式,实时介入并深度影响AI角色的行动乃至剧情的走向。

Vivix的独特之处

Vivix不仅仅是又一个AI模型,它代表着人机交互的一次飞跃。其核心亮点在于,它能够实现低于1.7秒的端到端首次反应延迟,并且在短短一年内,推理成本实现了两个数量级的惊人下降,如今已逼近主流视频平台的CDN带宽成本,甚至可以在消费级GPU上实现流畅的实时推理。这意味着,强大的人工智能交互体验,正以前所未有的速度走向普及。

Vivix的核心能力概览

  • 即时全双工交互:AI角色在进行对话或动作时,用户可以随时打断,通过语音或文字提出新意见、更换话题,角色将立即作出响应,无需等待当前回合结束,真正实现流畅、双向的人机对话。
  • 全方位角色与动作生成:Vivix模型赋予AI角色生命力,它们不仅能流畅对话,更能实时执行行走、转身、抓取物品等精细动作,并能与环境进行逼真的物理交互。无论用户需要写实人物、3D角色还是动漫形象,Vivix都能满足。
  • 原生音画同步生成:告别繁琐的后期合成,Vivix能够同步生成画面、对白、环境音效,确保口型、动作与声音的完美契合,提供真正视听一体化的沉浸式体验。
  • 动态多模态参考:用户可以通过语音、文字、图片等多种形式进行输入,并且可以在互动过程中动态地加入新的图片素材,AI角色将根据这些新信息实时调整其讲解内容和动作表现。
  • 原生多镜头叙事:Vivix具备如同电影导演般的叙事能力,能够自主切换视角、移动镜头,精准把握对白节奏与人物反应,实现电影级的实时导演与叙事效果。
  • 流式持续生成:通过小段流式生成机制,每一段内容都以前一段为基础,确保故事在长时间的演进中保持连贯性,避免出现剧情漂移。
  • 极致低延迟响应:其流式调度器处理新输入的最短响应时间仅需300毫秒,用户输入到画面首次可见的平均延迟低于0.6秒,端到端首次反应时间(TTFR)更是控制在1.7秒以内。
  • 消费级GPU的实时运行能力:借助MJD多维联合蒸馏、原生NVFP4训推协同以及VMI推理引擎的优化,300亿参数的模型,竟能在消费级显卡上实现实时推理。

如何开启Vivix的奇妙旅程

  • 官网申请内测体验:访问Vivix的官方网站 https://vivix.ai/ 或其API开放平台,提交您的体验申请。
  • 模型与场景的精准选择:根据您的具体需求,选择Vivix-A1(专注于角色实时交互)或Vivix-W1(侧重互动叙事与世界生成)。
  • 导入您的创意素材:上传您构思的角片、场景描述或语音指令,为故事或角色设定一个初步的基调。
  • 即时互动,主导剧情:通过语音、文字、点击或触控,与AI角色或故事进行深度互动,随时随地调整剧情发展或角色行为。
  • 动态调整,即时导出:在内容流式生成的过程中,您可以随时追加新的图片或修改指令,系统将实时重定向后续生成内容,无需从零开始。

Vivix的卓越优势

  • 极低的响应延迟:流式调度器处理新输入的响应时间最短仅需300毫秒,用户输入到画面首次显现的平均时间低于0.6秒,端到端TTFR更是低于1.7秒。
  • 消费级GPU的实时运行实力:通过MJD多维联合蒸馏、原生NVFP4训推协同和VMI推理引擎的协同作用,300亿参数模型被高效压缩,实现消费级显卡单卡超10,000 video tokens/s的处理速度。
  • 成本效益的性提升:推理与基础设施成本在一年内下降了约100倍,实时生成成本已接近YouTube每小时约0.2美元的CDN带宽成本。
  • 非级联的原生架构:抛弃了传统的ASR+LLM+TTS拼接管线,Vivix采用了端到端原生多模态生成循环,带来了更自然的交互体验和更低的延迟。
  • 长期的内容一致性保障:通过局部连续性衔接与全局序列先验机制,Vivix能够维持人物、背景、声音和动作在长时间生成过程中的稳定,有效避免画面漂移。

Vivix与竞品深度对比

对比维度Vivix智谱 GLM-Realtime
模型定位全球首个实时交互多模态基座模型端到端音视频通话多模态模型
核心架构统一流式架构,约300亿激活参数,端到端原生多模态生成循环端到端多模态模型,跨文本/音频/视频实时推理
实时交互模式全双工实时交互,用户可随时插话改变角色动作与剧情低延迟视频理解与语音交互,支持实时打断
视频能力侧重生成式:AI实时生成角色动作、场景与镜头叙事理解式:实时理解用户摄像头画面并语音回应
记忆时长流式持续生成,支持故事长期演进与一致性保持2分钟内容记忆
延迟表现流式调度器300ms,画面首次可见<0.6s,端到端TTFR<1.7s低延迟(强调“近乎实时”,具体数值未公开)
生成模态画面+对白+环境音+音效同步生成(音画联合)语音+文本输出(基于视频理解)
角色/动作生成支持全身角色行走、转身、拿取物品、物理交互无(侧重理解用户视频而非生成角色)
多模态输入语音、文字、图片、触控/点击视频、音频、文本
硬件要求消费级GPU可实时运行(单卡超10,000 video tokens/s)云端API调用,无本地硬件要求
API开放情况W1已开放API,A1开放内测申请已上线智谱开放平台,按分钟计费
定价参考推理成本一年内降低约100倍,接近CDN带宽成本音频0.18–0.3元/分钟,视频1.2–2.1元/分钟
特色功能电影级多镜头自主切换、角色风格自定义(写实/3D/动漫)、环境物理交互清唱功能、Function Call工具调用、口语陪练、面试模拟

Vivix的理想用户群体

  • 游戏开发者:对于构建开放世界剧情、实时NPC互动以及动态叙事的游戏工作室而言,Vivix是不可多得的利器。
  • 直播与内容创作者:希望打造独具特色的实时互动数字人、虚拟主播或沉浸式直播体验的团队,将从中获益匪浅。
  • 房产与电商营销:需要AI销售或导购进行线上房产带看、商品展示和实时答疑的企业,可以借助Vivix提升客户服务体验。
  • 教育与文旅机构:在开发虚拟导览、互动式讲解或沉浸式研学内容方面,Vivix能提供强大的技术支持。
  • AI研究者与开发者:对于关注实时多模态生成、流式架构以及低延迟推理技术的尖端技术人员,Vivix无疑是探索前沿的绝佳平台。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...