AI项目和框架

ebook2audiobookXTTS:多语言开源电子书转有声书AI工具,轻松转换16种语言的文本为生动音频

ebook2audiobookXTTS是开源的AI工具,能将电子书转换为有声书。ebook2audiobookXTTS支持多种电子书格式,如epub、pdf、mobi等,用Coqui XTTS技术实现高质量的...
阅读原文

Optima:提升通信效率与任务管理的创新训练框架

Optima是清华大学推出的优化基于大型语言模型(LLM)的多智能体系统(MAS)的框架。基于一个迭代的生成、排名、选择和训练范式,显著提高通信效率和任务效果...
阅读原文

MuCodec:超低比特率音乐编解码器实现高保真音质与极致压缩效率

MuCodec是清华大学深圳国际研究生院、腾讯AI实验室和香港中文大学的研究人员共同推出的超低比特率音乐编解码器,能实现音乐的高效压缩与高保真重建。MuCodec...
阅读原文

ACE:全能图像生成与编辑模型赋能创意无限可能

ACE(All-round Creator and Editor)是阿里巴巴集团Tongyi Lab推出的基于扩散变换器的全能图像生成和编辑模型。ACE引入长上下文条件单元(LCU)和统一条件格...
阅读原文

ViewExtrapolator:新型视图合成技术实现高质量视觉体验与灵活场景重建

ViewExtrapolator是南洋理工大学、UCAS研究团队共同推出的新视角外推方法,基于稳定视频扩散(Stable Video Diffusion, SVD)的生成先验合成远超出训练视图范...
阅读原文

OpenScholar:智能学术搜索工具助力高效研究与知识发现

OpenScholar是华盛顿大学和艾伦AI研究所共同推出的检索增强型语言模型(LM),能帮助科学家基于检索和综合科学文献中的相关论文回答问题。系统用大规模的科学...
阅读原文

SmolVLM:轻量级视觉语言模型助力多模态任务的高效解决方案

SmolVLM是Hugging Face推出的轻量级视觉语言模型,专为设备端推理设计。以20亿参数量,实现了高效内存占用和快速处理速度。SmolVLM提供了三个版本以满足不同...
阅读原文

Edify 3D:革新3D生成技术助力创意无限可能

Edify 3D 是 NVIDIA 推出的先进3D资产生成方案,能从文本提示或参考图像快速合成高质量的3D模型。Edify 3D能在两分钟内生成具有详细几何形状、清晰拓扑结构、...
阅读原文

SongCreator:智能音乐创作助手提升您的音乐创作体验

SongCreator是清华大学深圳国际研究生院、香港中文大学等机构推出的歌曲生成系统,能从歌词出发生成包含声乐和伴奏的完整歌曲。基于双序列语言模型(DSLM)和...
阅读原文

Teacher2Task:创新的多教师学习框架提升人工智能训练效率与精准性

Teacher2Task是谷歌团队推出的多教师学习框架,引入教师特定的输入标记和重新构思训练过程,消除对手动聚合启发式方法的需求。框架不依赖聚合标签,将训练数...
阅读原文

DynaSaur:Adobe创新推出的多功能大语言模型代理框架提升创作效率与智能化体验

DynaSaur是Adobe Research推出的大型语言模型(LLM)代理框架,突破传统LLM代理系统受限于预定义动作集合的限制。框架支持代理动态创建和组合动作,基于生成...
阅读原文

Takin AudioLLM:创新零样本语音生成模型助力个性化语音合成体验

Takin AudioLLM是喜马拉雅Everest团队推出的一系列高质量零样本语音生成模型,包括Takin TTS、Takin VC和Takin Morphing。模型用最新的大型语言模型技术,专...
阅读原文

AutoTrain:无代码模型训练平台助力轻松构建高性能AI应用

AutoTrain(AutoTrain Advanced)是Hugging Face推出的开源无代码平台,能简化最先进模型的训练过程。支持用户无需编写代码即可创建、微调和部署自己的AI模型...
阅读原文

CAMPHOR:创新端侧小语言模型推动多智能体协作与智能交互的新时代

CAMPHOR是苹果团队推出的端侧小语言模型(SLM)多智能体框架,能提升移动设备的隐私保护和响应速度。框架基于在设备本地处理多个用户输入并进行个人上下文推...
阅读原文

XGrammar:智能化结构化生成引擎提升文本创作效率与质量

XGrammar是由陈天奇团队推出的开源软件库,能为大型语言模型(LLM)提供高效、灵活且可移植的结构化数据生成能力。基于上下文无关语法(CFG)定义结构,支持...
阅读原文
16465666768115