AI项目和框架

Ling-3.0-flash-VL

Ling-3.0-flash-VL是蚂蚁InclusionAI百灵系列首个开源原生多模态大模型,MoE架构总参124B、单次推理仅激活5.5B,原生图文与视频输入、256K上下文,支持网页复...
阅读原文

H3-World

H3-World是腾讯联合新加坡国立大学、香港理工大学推出的动作可控世界模型,基于33B MiniMax-H3微调,键盘操作转英文指令经时间注意力路由绑定视频帧,8000条...
阅读原文

ChatGPT Images 2.5

ChatGPT Images 2.5 是 OpenAI 新一代图像生成模型,延迟最高降50%,支持局部精准调优、多轮不漂移与人物高保真,新增 @Sketch 手绘、模板与评论式编辑,API ...
阅读原文

MiniCPM5-2B

MiniCPM5-2B 是面壁智能、OpenBMB 与清华联合开源的 2.5B 端侧语言基座,128K 上下文、34 项基准均分 53.9、6GB 内存可跑,兼容 vLLM/llama.cpp。
阅读原文

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash 是深度求索于 2026 年 9 月 8 日开启内测的轻量原生多模态大模型,采用全新 MoE 架构,社区实测 300–500 tokens/s,API 零迁移接入,9 ...
阅读原文

WikiSkill

WikiSkill 是 Google Research 联合 Virginia Tech 提出的 AI Agent 技能进化框架,用三层工作空间把执行轨迹沉淀为持久化知识,再用四组件闭环让技能持续演...
阅读原文

LLaDA-Image

LLaDA-Image 是蚂蚁 inclusionAI 开源的 6B 统一图像生成与编辑模型,LLaDA2.0-mini + 6B DiT 全扩散,Qwen-Image-Bench 中英双榜开源第一,Turbo 2-4 步出图。
阅读原文

MAI-Image-2.6-Flash

MAI-Image-2.6-Flash 是微软推出的高速图像生成模型,生成速度达 GPT-Image-2-Medium 的 2.8 倍、GPU 效率提升 72%,支持多参考图、Web Grounding 与 1.5K 分...
阅读原文

Claude Commerce Agents

Claude Commerce Agents 是 Anthropic 开源的电商 Agent 蓝图,含购物与商家两类 Agent,覆盖零售、旅游、电信、票务四行业,Apache 2.0 协议,内置双层安全...
阅读原文

PatentClaw

PatentClaw 是把 LaTeX 科研论文自动整理成中国发明专利技术交底书的开源工具。多智能体协作完成论文解析、发明点挖掘与初稿撰写,公式表格算法证据可溯源,...
阅读原文

星火X2.5

星火X2.5是科大讯飞推出的旗舰通用大模型系列,包含云端MoE基座(293B/30B)与端侧4B/1.7B开源模型,依托全国产算力训练,兼容昇腾、海光等国产芯片,端侧原...
阅读原文

Kage

Kage 是设计师 Meng To 开源的沉浸式 3D 交互体验项目。整个作品封装在单个 HTML 文件中,借助 Three.js 实时渲染并叠加 GPT Image 2 生成的场景素材,构建一...
阅读原文

Obscura

Obscura 是面向 AI Agent 与自动化场景的开源无头浏览器,由 Rust 构建,采用自研渲染引擎与内嵌 V8,不依赖 Chromium 与 Node.js。单文件 70MB、内存占用约 ...
阅读原文

Orbis

Orbis是Visko推出的首个Live Model实时世界模型,支持4K@24FPS实时流式视频生成,生成过程中可随时输入新指令改变画面走向;多尺度记忆机制支撑小时级长时一...
阅读原文

MAI-Transcribe-2

MAI-Transcribe-2 是微软推出的最强 AI 语音转文字模型,支持 60 种语言、FLEURS 平均词错误率仅 5.2%,推理速度领先 Whisper V3-Large 等竞品,按小时计费成...
阅读原文
123216