AI工具

Wan3.0

Wan3.0 是阿里云万相团队最新推出的视频生成大模型。模型在生成时长、万能创作、全能参考与真实感等维度全面升级,单次可生成 30秒 视频,首次支持 doc、xls...
阅读原文

Hunyuan3D-Buffalo 1.0

Hunyuan3D-Buffalo 1.0 是腾讯混元推出的统一3D多模态框架,通过共享的 Hunyuan3D-VLM 主干将3D问答、空间定位、文生3D、指令编辑和部件生成集成到单一流程中。
阅读原文

Omega

Omega 是腾讯推出的 AI 原生数据分析平台,内测版名为「马尔摩斯(marmos)」。工具通过 Agent 驱动完整分析链路,让用户用自然语言可生成可交互、可迭代、可...
阅读原文

Muse Code

Muse Code 是 Meta 推出的终端编程 AI 智能体,基于 Muse Spark 1.2 模型,可处理大型代码库中的完整软件工程任务,包括规划变更、编写代码与验证结果。
阅读原文

Acti

Acti 是新加坡团队开发的 AI 智能键盘。键盘将 AI 嵌入手机键盘层,用户长按空格键即可触发 Acti Bar,无需跳转应用可查信息、搜文件、建会议或运行工作流。
阅读原文

InstructAV2AV

InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应...
阅读原文

RabbitVis

RabbitVis 是兔展智能推出的图层级一站式 AI 设计生产工具,基于自研 UniWorld-Design 视觉大模型,将 AI 生成能力与图层编辑能力深度融合。
阅读原文

SeedRealtime

 SeedRealtime是字节跳动Seed团队推出的原生音视频全双工大模型,基于统一架构原生融合音频、视频与文本,实现边看、边听、边说的全模态实时交互。
阅读原文

JoyAI-Video-Edit

JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。
阅读原文

MAGI-2-preview

MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 T...
阅读原文

Shieldstral

Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支...
阅读原文

Hy ASR 3.0 preview

Hy ASR 3.0 preview是腾讯混元推出的新一代语音识别模型,基于 Hy3 大语言模型,融合高精度语音识别与深度语义理解。模型支持中文、英语、粤语及10大方言片区...
阅读原文

MemHarness

MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经...
阅读原文

Qwen-CUA

Qwen-CUA 是 Qwen 团队与 XLang Lab 联合推出的原生 Computer Use Agent,基于 397B-A17B 混合专家架构,仅通过截图感知界面状态,无需依赖 DOM 树或辅助功能...
阅读原文

E-Bench

E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准,基于王者荣耀、QQ 音乐、腾讯会议三大真实产品为原型,构建全合成虚拟环境...
阅读原文
123360