2026世界人工智能大会期间,虎牙在腾讯AI应用创新论坛上发布了基于DiT架构的实时多模态基础模型“虎牙VAM 1.0”。
该模型可通过单张照片生成能说话、歌唱及舞蹈的AI数字人,并支持实时互动。其生成的数字人主播在声音、微表情等方面与真人高度相似,令现场观众感到非常逼真。
据悉,模型能以480×832分辨率、28帧实时流式输出,可连续运行24小时以上。它具备覆盖静默、聆听、说话三种状态的全状态拟人交互仿真能力,支持全双工交互、即时打断与自然过渡。
2026世界人工智能大会期间,虎牙在腾讯AI应用创新论坛上发布了基于DiT架构的实时多模态基础模型“虎牙VAM 1.0”。
该模型可通过单张照片生成能说话、歌唱及舞蹈的AI数字人,并支持实时互动。其生成的数字人主播在声音、微表情等方面与真人高度相似,令现场观众感到非常逼真。
据悉,模型能以480×832分辨率、28帧实时流式输出,可连续运行24小时以上。它具备覆盖静默、聆听、说话三种状态的全状态拟人交互仿真能力,支持全双工交互、即时打断与自然过渡。