AI项目和框架

ABot-Earth 0.7

ABot-Earth 0.7 是高德推出的全球首个 3D 原生城市世界模型:输入卫星图或文字,10 分钟在消费级 GPU 生成公里级 3D 城市,端到端输出 3DGS,覆盖 196+ 国家...
阅读原文

EchoWM

EchoWM 是京东探索研究院开源的交互式视听世界模型,继承 JoyAI-Echo 原生音视频生成能力,支持 WASD 键实时漫游、第一/第三人称双视角与 720p 视听同步输出...
阅读原文

NeoHorse-1

NeoHorse-1 是基元律动联合无问芯穹、清华、北大等开源的 Agent 模型,含 4B/9B 两版,采用 Agent-Native 后训练与 Routing Harness 真实执行轨迹,原生上下...
阅读原文

VDN-MiniMax-H3

VDN-MiniMax-H3 是 OpenVDN 团队开源的视频生成加速方案,基于 MiniMax-H3 改造,采用混合注意力与 DMD2 蒸馏把去噪步数压缩到 8 步,8 张 B200 约 11 秒生成...
阅读原文

Suno v6

Suno v6 是 Suno 新一代 AI 音乐生成模型系列,含旗舰 v6、实验性 v6-wild 与免费 v6-mini,支持自然语言局部编辑、多音频源混音、采样提取与图片视频生成歌...
阅读原文

teamai-cli

teamai-cli是腾讯开源的MIT协议CLI工具,用Git仓库统一管理团队AI编程配置skills、rules、MCP与hooks,通过push到MR再到merge与pull的工作流分发到Claude Cod...
阅读原文

PixRestore

PixRestore 是香港理工大学与 OPPO 研究院联合推出的统一图像修复模型,采用像素空间 Diffusion Transformer 与 flow matching,53.7M 参数覆盖八大类图像退...
阅读原文

ffmpeg-skill

ffmpeg-skill 是面向 Claude Code、Cursor、Codex 的开源 Agent Skill,内置 28 个结构化工具覆盖探测、剪切、字幕、调色、响度到批量导出,纯本地零费用,np...
阅读原文

AuK

AuK是腾讯混元开源的15亿参数语音生成与编辑基础模型,采用流匹配扩散架构,通过统一自然语言指令完成零样本TTS、语音内容编辑、声学调节、副语言编辑、降噪...
阅读原文

Ling-3.0-flash-VL

Ling-3.0-flash-VL是蚂蚁InclusionAI百灵系列首个开源原生多模态大模型,MoE架构总参124B、单次推理仅激活5.5B,原生图文与视频输入、256K上下文,支持网页复...
阅读原文

H3-World

H3-World是腾讯联合新加坡国立大学、香港理工大学推出的动作可控世界模型,基于33B MiniMax-H3微调,键盘操作转英文指令经时间注意力路由绑定视频帧,8000条...
阅读原文

ChatGPT Images 2.5

ChatGPT Images 2.5 是 OpenAI 新一代图像生成模型,延迟最高降50%,支持局部精准调优、多轮不漂移与人物高保真,新增 @Sketch 手绘、模板与评论式编辑,API ...
阅读原文

MiniCPM5-2B

MiniCPM5-2B 是面壁智能、OpenBMB 与清华联合开源的 2.5B 端侧语言基座,128K 上下文、34 项基准均分 53.9、6GB 内存可跑,兼容 vLLM/llama.cpp。
阅读原文

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash 是深度求索于 2026 年 9 月 8 日开启内测的轻量原生多模态大模型,采用全新 MoE 架构,社区实测 300–500 tokens/s,API 零迁移接入,9 ...
阅读原文

WikiSkill

WikiSkill 是 Google Research 联合 Virginia Tech 提出的 AI Agent 技能进化框架,用三层工作空间把执行轨迹沉淀为持久化知识,再用四组件闭环让技能持续演...
阅读原文
123216