AI项目和框架

PixRestore

PixRestore 是香港理工大学与 OPPO 研究院联合推出的统一图像修复模型,采用像素空间 Diffusion Transformer 与 flow matching,53.7M 参数覆盖八大类图像退...
阅读原文

ffmpeg-skill

ffmpeg-skill 是面向 Claude Code、Cursor、Codex 的开源 Agent Skill,内置 28 个结构化工具覆盖探测、剪切、字幕、调色、响度到批量导出,纯本地零费用,np...
阅读原文

AuK

AuK是腾讯混元开源的15亿参数语音生成与编辑基础模型,采用流匹配扩散架构,通过统一自然语言指令完成零样本TTS、语音内容编辑、声学调节、副语言编辑、降噪...
阅读原文

Ling-3.0-flash-VL

Ling-3.0-flash-VL是蚂蚁InclusionAI百灵系列首个开源原生多模态大模型,MoE架构总参124B、单次推理仅激活5.5B,原生图文与视频输入、256K上下文,支持网页复...
阅读原文

H3-World

H3-World是腾讯联合新加坡国立大学、香港理工大学推出的动作可控世界模型,基于33B MiniMax-H3微调,键盘操作转英文指令经时间注意力路由绑定视频帧,8000条...
阅读原文

ChatGPT Images 2.5

ChatGPT Images 2.5 是 OpenAI 新一代图像生成模型,延迟最高降50%,支持局部精准调优、多轮不漂移与人物高保真,新增 @Sketch 手绘、模板与评论式编辑,API ...
阅读原文

MiniCPM5-2B

MiniCPM5-2B 是面壁智能、OpenBMB 与清华联合开源的 2.5B 端侧语言基座,128K 上下文、34 项基准均分 53.9、6GB 内存可跑,兼容 vLLM/llama.cpp。
阅读原文

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash 是深度求索于 2026 年 9 月 8 日开启内测的轻量原生多模态大模型,采用全新 MoE 架构,社区实测 300–500 tokens/s,API 零迁移接入,9 ...
阅读原文

WikiSkill

WikiSkill 是 Google Research 联合 Virginia Tech 提出的 AI Agent 技能进化框架,用三层工作空间把执行轨迹沉淀为持久化知识,再用四组件闭环让技能持续演...
阅读原文

LLaDA-Image

LLaDA-Image 是蚂蚁 inclusionAI 开源的 6B 统一图像生成与编辑模型,LLaDA2.0-mini + 6B DiT 全扩散,Qwen-Image-Bench 中英双榜开源第一,Turbo 2-4 步出图。
阅读原文

MAI-Image-2.6-Flash

MAI-Image-2.6-Flash 是微软推出的高速图像生成模型,生成速度达 GPT-Image-2-Medium 的 2.8 倍、GPU 效率提升 72%,支持多参考图、Web Grounding 与 1.5K 分...
阅读原文

Claude Commerce Agents

Claude Commerce Agents 是 Anthropic 开源的电商 Agent 蓝图,含购物与商家两类 Agent,覆盖零售、旅游、电信、票务四行业,Apache 2.0 协议,内置双层安全...
阅读原文

PatentClaw

PatentClaw 是把 LaTeX 科研论文自动整理成中国发明专利技术交底书的开源工具。多智能体协作完成论文解析、发明点挖掘与初稿撰写,公式表格算法证据可溯源,...
阅读原文

星火X2.5

星火X2.5是科大讯飞推出的旗舰通用大模型系列,包含云端MoE基座(293B/30B)与端侧4B/1.7B开源模型,依托全国产算力训练,兼容昇腾、海光等国产芯片,端侧原...
阅读原文

Kage

Kage 是设计师 Meng To 开源的沉浸式 3D 交互体验项目。整个作品封装在单个 HTML 文件中,借助 Three.js 实时渲染并叠加 GPT Image 2 生成的场景素材,构建一...
阅读原文