AI项目和框架

Qwen-CUA

Qwen-CUA 是 Qwen 团队与 XLang Lab 联合推出的原生 Computer Use Agent,基于 397B-A17B 混合专家架构,仅通过截图感知界面状态,无需依赖 DOM 树或辅助功能...
阅读原文

E-Bench

E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准,基于王者荣耀、QQ 音乐、腾讯会议三大真实产品为原型,构建全合成虚拟环境...
阅读原文

SenseNova U1.5-Lite-Preview

SenseNova U1.5-Lite-Preview 是商汤科技开源的轻量级原生统一多模态模型预览版,基于 NEO-Unify 架构迭代,仅 8B-MoT 参数即贯通视觉理解、推理、生成与编辑。
阅读原文

MindMemOS

MindMemOS 是华为诺亚方舟实验室开源的 AI Agent 记忆操作系统,能解决 Agent 用完即忘的痛点。系统将记忆从单个 Agent 中解耦为可跨框架复用的独立资产,采...
阅读原文

Qwen 3.8-Max

Qwen 3.8-Max 是阿里云 Qwen 团队推出的旗舰大模型,总参数量达 2.4 万亿,基于 Qwen 3.5 架构扩展而成。作为 Qwen 家族迄今最强大的模型,是首个即将开源权...
阅读原文

FeyNoBg

FeyNoBg 是 Feyn Labs 推出的开源自动背景去除模型,基于 BiRefNet 架构深度改进,拥有 2.63 亿参数。模型在 UHRSD-TE、HRSOD-TE 等 8 项基准测试中,有 4 项...
阅读原文

Qwen-Audio-3.0-ASR-Flash

Qwen-Audio-3.0-ASR-Flash 是阿里千问团队推出的语音识别大模型,现已通过阿里云百炼平台开放调用,提供 Flash、Filetrans、Streaming 三个版本。
阅读原文

MiniMax H3

MiniMax H3 是稀宇科技推出的通用全模态生成模型,打破传统任务与模态边界,支持对文本、图像、视频、音频的统一理解与原生生成。模型能输出原生双声道音视频...
阅读原文

Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 是 SpaceXAI(xAI)推出的端到端语音到语音模型,采用原生语音到语音架构,无需经过识别—推理—合成多阶段流程即可直接理解并回应...
阅读原文

AngelSpec

AngelSpec 是腾讯混元团队开源的端到端推测解码训练框架,基于 TorchSpec 构建,支持 MTP 自回归与 DFly 块并行共 6 种草稿架构。推理与训练解耦,推理引擎经...
阅读原文

Codex Security CLI

Codex Security CLI是OpenAI开源的AI代码安全扫描CLI工具,前身为Codex内置的闭源安全插件。工具基于大模型语义理解自动扫描代码漏洞,深度验证攻击路径真实...
阅读原文

Lyria 3.5

Lyria 3.5是Google DeepMind 在 Google Flow Music 中推出的新一代音乐生成模型,实现音乐性、歌词质量、人声表现力与创作控制四项核心升级。
阅读原文

Instella-MoE

Instella-MoE 是 AMD 开源的混合专家语言模型系列,总参数量 16B、激活参数量 2.8B,采用 27 层解码器架构。模型基于 AMD Instinct MI300X / MI325X GPU 及 R...
阅读原文

JiuwenSwarm

JiuwenSwarm是华为2012实验室、华为云、终端小艺等团队联合构建的开源AI Agent平台,也是首个面向鸿蒙PC的开源AI统一工作台。平台采用多智能体协同架构,支持...
阅读原文

Qwen-Audio-Agent

Qwen-Audio-Agent 是阿里语音AI团队推出的开源实时语音 Agent 框架,基于 Qwen-Audio-3.0-Realtime 模型构建。框架作为统一的实时语音入口层,让用户通过自然...
阅读原文
134567212