AI工具

GraphMaker

GraphMaker 是一款基于AI技术的图表制作工具,能理解自然语言指令,帮助用户快速将数据以图表形式可视化。用户只需上传电子表格数据,用自然语言描述图表类型...
阅读原文

FaceFusion

FaceFusion是开源的AI换脸工具,支持图像和视频处理。具备多种人脸交换和增强模型,能处理高清内容解决遮挡问题。FaceFusion兼容NVIDIA和AMD显卡,提供音频到...
阅读原文

Westlake-Omni

Westlake-Omni 是西湖心辰推出的全球首个开源中文情感端到端语音交互大模型。模型采用离散表示法,统一文本和语音模态的处理,特别强调实时性,快速响应用户...
阅读原文

AutoGen Studio

AutoGen Studio 是微软研究院推出的一款开源界面工具,旨在简化多智能体系统的构建、调试和评估过程。AutoGen Studio提供一个基于 Web 的交互式界面和 Python...
阅读原文

Zeemo

Zeemo 是一款AI驱动的视频字幕生成工具,能自动检测并转录多达95种语言的语音,将字幕翻译成113种语言。工具为视频创作者提供快速、高效的方式增加视频的全球...
阅读原文

IDIFY

IDIFY是一款免费开源的在线证件照生成工具,通过AI技术实现自动抠图,帮助用户快速生成符合标准的证件照。用户只需在浏览器中上传照片,选择尺寸和背景色,可...
阅读原文

Emu3

Emu3是由北京智源人工智能研究院推出的一款原生多模态世界模型,采用智源自研的多模态自回归技术路径,在图像、视频、文字上联合训练,使模型具备原生多模态...
阅读原文

AEE

AEE(Auto Excel Editor)是一款在线AI Excel编辑器,基于AI技术自动化Excel表格的编辑和管理任务。用户只需输入简单的提示语,AEE自动执行数据的增删改查等...
阅读原文

CCI 3.0

CCI 3.0是智源研究院发布的一个大规模的中文互联网语料库,包含了1000GB的数据集和498GB的高质量子集CCI 3.0-HQ。该版本在数据规模上相较于CCI 2.0扩大了近一...
阅读原文

MemFree

MemFree是一款开源的混合AI搜索引擎,通过整合多种AI模型和搜索引擎,提供高效、多样化的搜索体验。可以用文本、图像、文件和网页等多种方式进行搜索和提问,...
阅读原文

GarDiff

GarDiff是一种创新的虚拟试穿技术,通过使用CLIP和VAE编码来提取服装的外观先验,结合服装聚焦适配器和高频细节增强算法,生成高保真且细节丰富的试穿图像。...
阅读原文

NeMo

NeMo 是由 NVIDIA 提供的端到端云原生框架,用于构建、定制和部署生成式 AI 模型。支持大型语言模型(LLMs)、多模态模型、语音识别和文本转语音(TTS)等应...
阅读原文

Oryx

Oryx是由清华大学、腾讯和南洋理工大学联合推出的多模态大型语言模型(MLLM),基于两项核心创新来处理视觉数据,预训练的OryxViT模型和动态压缩模块。OryxVi...
阅读原文

I2VEdit

I2VEdit是一个先进的视频编辑框架,通过图像到视频的扩散模型实现首帧引导的视频编辑。用户只需编辑视频的第一帧,I2VEdit能自动将编辑效果应用到整个视频。
阅读原文

HouseCrafter

HouseCrafter 是由东北大学和 Stability AI 推出的先进技术,将二维平面图自动转换成三维室内场景。基于一个网络规模图像训练的2D扩散模型,生成一致的多视图...
阅读原文