AI项目和框架

LoHoSearch

LoHoSearch 是美团 LongCat 团队推出的下一代搜索智能体评测基准,基于覆盖 762 万维基百科实体、2.65 亿条关系边的知识图谱自动生成题目,替代传统人工出题...
阅读原文

MiniCPM-Robot

MiniCPM-Robot是面壁智能开源的轻量具身智能 VLA 模型系列,包含 1.5B 参数的 MiniCPM-RobotManip 通用操作模型与 0.9B 参数的 MiniCPM-RobotTrack 跟踪导航...
阅读原文

Tempolor v4.7

Tempolor v4.7是趣丸科技推出的旗舰级AI音乐生成大模型,采用第四代分层渐进式架构,支持48kHz双声道高品质输出。
阅读原文

Qwen3.8-Max-Preview

Qwen3.8-Max-Preview 是阿里通义千问推出的最新一代基座大模型的预览版,参数量达 2.4T,已上线 Qoder、Token Plan 及 QoderWork 平台。
阅读原文

MuScriptor

MuScriptor 是 Kyutai 与 Mirelo 联合推出的开源多乐器音乐转录模型,可将真实世界多种流派的音乐音频自动转录为 MIDI。
阅读原文

Kimi K3

Kimi K3 是月之暗面推出的 2.8 万亿参数开源大模型,基于 KDA 混合线性注意力机制与注意力残差技术构建,原生支持视觉理解,拥有 100 万 token 上下文窗口。
阅读原文

Nemotron 3 Embed

Nemotron 3 Embed 是 NVIDIA 开源的文本嵌入模型系列,专为检索增强生成与智能体检索设计。模型包含 8B 和 1B 两种参数规模,支持 32k 上下文窗口与 34 种语...
阅读原文

StaffDeck

StaffDeck 是面壁智能联合东北大学-面壁智能数据智能联合实验室、清华大学 THUNLP 实验室、OpenBMB 与 AI9Stars 开源的数字员工全流程构建与管理平台。
阅读原文

Wan-Streamer v0.2

Wan-Streamer v0.2 是阿里通义实验室推出的面向实时双工交互的端到端全模态理解与生成模型。模型将"听、看、说、演"统一进单个 Transformer,原生...
阅读原文

Inkling

Inkling 是 Thinking Machines Lab 推出的开放权重多模态基础模型。模型原生支持文本、图像与音频输入,采用混合专家架构,在 410 亿激活参数下实现跨模态推...
阅读原文

OvisOCR2

OvisOCR2 是阿里 ATH-MaaS 团队推出的端到端文档解析模型,基于 Qwen3.5-0.8B 训练并完全开源。模型在 OmniDocBench v1.6 评测中以 96.58 分登顶榜首,具备对...
阅读原文

X2.0

X2.0 是 Xmax AI 推出的全球首个实时交互视频生成模型,支持毫秒级流式生成。用户通过摄像头可实时替换角色服装、召唤虚拟物体、触屏操控画面,实现可玩的视...
阅读原文

ABot-World Studio

ABot-World Studio 是高德推出的通用世界模型工坊,将交互式视频生成与 3DGS 场景生成统一于同一产品。用户输入文字或图片可生成可实时交互的 AI 世界,支持...
阅读原文

MOSS-VL-Realtime

MOSS-VL-Realtime 是 OpenMOSS 开源的 11B 参数流式视觉语言模型,专为实时视频理解设计。模型支持边看边答、即时修正与主动沉默,将视频理解从看录像升级为...
阅读原文

Xiaomi-Robotics-U0

Xiaomi-Robotics-U0 是小米推出的 380 亿参数统一具身合成模型,基于世界基础模型持续训练,联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生...
阅读原文
134567209