Hunyuan3D-Buffalo 1.0
Hunyuan3D-Buffalo 1.0 是腾讯混元推出的统一3D多模态框架,通过共享的 Hunyuan3D-VLM 主干将3D问答、空间定位、文生3D、指令编辑和部件生成集成到单一流程中。
InstructAV2AV
InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应...
JoyAI-Video-Edit
JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。
MAGI-2-preview
MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 T...
Shieldstral
Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支...
Hy ASR 3.0 preview
Hy ASR 3.0 preview是腾讯混元推出的新一代语音识别模型,基于 Hy3 大语言模型,融合高精度语音识别与深度语义理解。模型支持中文、英语、粤语及10大方言片区...
MemHarness
MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经...
SenseNova U1.5-Lite-Preview
SenseNova U1.5-Lite-Preview 是商汤科技开源的轻量级原生统一多模态模型预览版,基于 NEO-Unify 架构迭代,仅 8B-MoT 参数即贯通视觉理解、推理、生成与编辑。