标签:多语言支持
Lumina-Video
Lumina-Video是上海 AI Lab 和香港中文大学推出的视频生成框架,基于Next-DiT架构,针对视频生成中的时空复杂性进行优化。基于多尺度Next-DiT架构,用不同大...
Zonos-v0.1
Zonos-v0.1是Zyphra推出的高保真文本到语音(TTS)模型。Zonos-v0.1包含两个模型:16亿参数的Transformer模型和SSM混合模型,均在Apache 2.0许可下开源。Zono...
WorldSense
WorldSense是小红书和上海交通大学推出的,用在评估多模态大型语言模型(MLLMs)在现实世界场景中对视觉、听觉和文本输入的综合理解能力的基准测试。WorldSen...
AI Chat-avatar
AI Chat-avatar 是 AI 驱动的数字人交互助手,通过高度个性化的互动体验提升沟通效率与用户参与度。具备多语言支持,能实时翻译并进行自然对话,打破语言障碍...