Vivix是专注实时互动多模态模型的AI创作平台,核心产品包括:Vivix-A1,全球首个实时全双工模型,可生成有全身动作、能听、能说、能做的交互式AI角色;Vivix-W1,流式原生多模态模型,可通过语音、文字、触控实时改变剧情走向的互动叙事引擎及实时视频运行时Vivix IVI。Vivix自研MJD蒸馏、NVFP4量化与VMI推理引擎,实现近30B参数模型在消费级GPU上实时运行,交互延迟低于1秒,Vivix-A1 已开放API。
Vivix的主要功能
-
全身角色生成:Vivix-A1 可实时生成会行走、转身、拿取物体、跳舞的全身AI数字人。
-
全双工实时交互:用户可随时语音打断,角色的动作、表情与回应即时改变,无需中断重生成。
-
音画同步输出:语音、表情、手势、环境声原生统一建模,无拼接痕迹。
-
互动叙事生成:Vivix-W1 输入一句话可生成持续演进的音视频故事,用户可实时改变剧情走向。
-
多模态输入:支持语音、文字、图片、点击、触控等多种方式参与互动。
-
直播电商应用:数字主播可自由走动、展示商品,运营人员可实时语音调整直播方向。
-
超低延迟:首帧延迟小于 0.6 秒,打断响应 300–900 毫秒,端到端延迟小于 1.7 秒。
-
消费级硬件实时运行:近 30B 激活参数模型通过 MJD 蒸馏与 NVFP4 量化,可在消费级 GPU 上单卡实时推理,成本低于每小时 1 美元。
如何使用Vivix
- 注册获取 API Key:访问 Vivix API 开放平台 https://platform.vivix.ai/ ,注册账号,在开发者后台创建 API Key,所有请求以
https://api.vivix.ai 为 base URL 并携带 Bearer 认证。
- 选择模型:按需求选 A 系列(实时 Avatar 交互或脚本驱动 Avatar 视频)或 W 系列,如
vivix-a1-stream、vivix-w1-stream 等。
- 创建会话:通过 REST 接口 POST
/v1/realtime-avatar/sessions,配置模式、角色形象图、音色、人设指令、语音识别(如 server_vad)等参数。
- 建立实时连接:拿到返回的
session_id 后,通过 WebSocket 控制通道(wss://api.vivix.ai/v1/realtime-avatar/control)操控会话,音画输出通过 RTC(TRTC)流传输。
- 驱动交互:把用户语音或文字写入对话上下文,Avatar 实时生成回复并以语音、视频、逐字字幕流式输出,支持中途打断。
- 实时干预:通过 Streaming Control 接口可在生成中切换图片/角色、发送动作指令或直接脚本音频,无需中断重来。
- W1 世界玩法:以开放事件(Event)驱动剧情,事件可在生效前取消,会话支持 hold/pause 与 resume,随时插入新事件改变故事走向。
Vivix的核心优势
-
真全双工交互:突破”半双工”请求-响应模式,模型在持续生成音视频的同时能随时接住新输入并即时改变内容。
-
全身角色行动力:A1 是首个支持完整全身动作生成的实时模型,角色能行走、转身、拿取物体,而不只是固定机位对口型。
-
原生多模态架构:语音、文字、图片在统一信号空间中建模,绕开 ASR+LLM+TTS 级联,感知直接驱动行为,音画动作自然同步。
-
超低延迟:首帧延迟 < 0.6 秒、打断响应 300–900 毫秒、端到端 < 1.7 秒,交互延迟低于 1 秒。
-
大参数 + 消费级实时运行:近 30B 激活参数配合 8x8x4 高质量压缩率,通过 MJD 蒸馏与训练期 NVFP4 量化,在消费级 GPU 上单卡跑出超 10,000 video tokens/s,推理成本低于每小时 1 美元。
-
原生可打断的流式架构:因果生成 + VMI 编解码解耦设计,新指令直接在解码链路追加,当前生成无需中断重来。
Vivix的应用场景
- 直播电商:数字主播全身出镜走动、试穿拿取商品,运营人员实时语音调整话术和选品,无需中断直播。
- 虚拟伴侣/AI 社交:AI 女友/男友类应用,动作、表情、声音自然同步,用户可随时打断对话,角色即时应变。
- 互动影视/互动短剧:输入一句话生成实时演进的故事,观众通过语音、点击参与剧情决策,开启”每个人都是导演”的观剧模式。
- 游戏 NPC 与开放世界:赋予游戏角色自主感知和行动能力,玩家语音即可与 NPC 自然交互,推动开放世界叙事。
- 智能客服与虚拟导购:7×24 小时在线的全身数字员工,能演示产品、答疑并实时响应客户需求,可嵌入网站/App/线下大屏。