AI项目和框架

Qwen-Image-3.0

Qwen-Image-3.0是阿里通义千问团队推出第三代图像生成基础模型。模型支持 4.5k token 超长输入,可一次性渲染复杂九宫格知识图鉴;支持 10px 小字 精准排版,...
阅读原文

Audio-Visual Flamingo

Audio-Visual Flamingo(简称 AV-Flamingo)是 NVIDIA 与马里兰大学联合推出的开源音频-视觉大语言模型,专为长视频与复杂真实世界音视频内容的联合理解与推...
阅读原文

问小白 5 Pro

问小白 5 Pro 是元石科技推出的新一代长内容生成引擎,基于自研元石大模型与 DeepSeek-R1 671B 满血版构建,主打长、稳、可查三大能力。
阅读原文

Matrix -Game3.5

Matrix-Game 3.5 是昆仑万维黎曼动力团队开源的实时流式交互世界模型,基于 Patch Memory 与 Warped PRoPE 实现三维空间级长期记忆与几何一致性建模。
阅读原文

Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS 是阿里通义千问推出的语音合成大模型,包含面向实时交互的 Flash 版与面向高质量生成的 Plus 版。
阅读原文

LoHoSearch

LoHoSearch 是美团 LongCat 团队推出的下一代搜索智能体评测基准,基于覆盖 762 万维基百科实体、2.65 亿条关系边的知识图谱自动生成题目,替代传统人工出题...
阅读原文

MiniCPM-Robot

MiniCPM-Robot是面壁智能开源的轻量具身智能 VLA 模型系列,包含 1.5B 参数的 MiniCPM-RobotManip 通用操作模型与 0.9B 参数的 MiniCPM-RobotTrack 跟踪导航...
阅读原文

Tempolor v4.7

Tempolor v4.7是趣丸科技推出的旗舰级AI音乐生成大模型,采用第四代分层渐进式架构,支持48kHz双声道高品质输出。
阅读原文

Qwen3.8-Max-Preview

Qwen3.8-Max-Preview 是阿里通义千问推出的最新一代基座大模型的预览版,参数量达 2.4T,已上线 Qoder、Token Plan 及 QoderWork 平台。
阅读原文

MuScriptor

MuScriptor 是 Kyutai 与 Mirelo 联合推出的开源多乐器音乐转录模型,可将真实世界多种流派的音乐音频自动转录为 MIDI。
阅读原文

Kimi K3

Kimi K3 是月之暗面推出的 2.8 万亿参数开源大模型,基于 KDA 混合线性注意力机制与注意力残差技术构建,原生支持视觉理解,拥有 100 万 token 上下文窗口。
阅读原文

Nemotron 3 Embed

Nemotron 3 Embed 是 NVIDIA 开源的文本嵌入模型系列,专为检索增强生成与智能体检索设计。模型包含 8B 和 1B 两种参数规模,支持 32k 上下文窗口与 34 种语...
阅读原文

StaffDeck

StaffDeck 是面壁智能联合东北大学-面壁智能数据智能联合实验室、清华大学 THUNLP 实验室、OpenBMB 与 AI9Stars 开源的数字员工全流程构建与管理平台。
阅读原文

Wan-Streamer v0.2

Wan-Streamer v0.2 是阿里通义实验室推出的面向实时双工交互的端到端全模态理解与生成模型。模型将"听、看、说、演"统一进单个 Transformer,原生...
阅读原文

Inkling

Inkling 是 Thinking Machines Lab 推出的开放权重多模态基础模型。模型原生支持文本、图像与音频输入,采用混合专家架构,在 410 亿激活参数下实现跨模态推...
阅读原文
123205