AI工具

PNGMaker

PNGMaker 是在线 AI 驱动的工具,能将文本快速转换为透明背景的 PNG 图像。PNGMaker为网页设计师、营销人员和内容创作者提供免费服务,具备 AI 驱动转换、自...
阅读原文

Jammable

Jammable是AI音乐翻唱平台。用户选择喜欢的歌手声音或风格,让AI模仿创作出个性化的音乐作品。平台提供热门声音、音乐合集和合作作品展示,方便用户了解流行...
阅读原文

DynVFX

DynVFX是创新的视频增强技术,能根据简单的文本指令将动态内容无缝集成到真实视频中。通过结合预训练的文本到视频扩散模型和视觉语言模型(VLM),实现了在不...
阅读原文

Omakase AI

Omakase AI 是 ZEALS 推出的智能购物助手工具,通过简单的网址输入,为用户提供个性化的商品推荐。用户只需提供目标网址,如商品平台或品牌官网,Omakase AI ...
阅读原文

WorldSense

WorldSense是小红书和上海交通大学推出的,用在评估多模态大型语言模型(MLLMs)在现实世界场景中对视觉、听觉和文本输入的综合理解能力的基准测试。WorldSen...
阅读原文

Airweave

Airweave 是开源工具,能将任何应用程序的数据(包括API、数据库、网站等)同步到图数据库和向量数据库中,让数据能基于智能代理或搜索机制进行检索。Airweav...
阅读原文

FireRedASR

FireRedASR 是小红书开源的工业级自动语音识别(ASR)模型家族,支持普通话、中文方言和英语,在普通话 ASR 基准测试中达到了新的最佳水平(SOTA),在歌词识...
阅读原文

AI Chat-avatar

AI Chat-avatar 是 AI 驱动的数字人交互助手,通过高度个性化的互动体验提升沟通效率与用户参与度。具备多语言支持,能实时翻译并进行自然对话,打破语言障碍...
阅读原文

MVoT

MVoT(Multimodal Visualization-of-Thought)是微软研究院、剑桥大学语言技术实验室、中国科学院自动化研究所推出的新型多模态推理范式,基于生成图像可视化...
阅读原文

HMA

HMA(Heterogeneous Masked Autoregression)是麻省理工学院、Meta和伊利诺伊大学香槟分校开源的,用在建模机器人动作视频动态的方法。HMA基于异构预训练,用...
阅读原文

鲸喷 DeepRant

DeepRant(中文名:鲸喷)是专为游戏玩家设计的多语言快捷翻译工具。DeepRant能够帮助玩家在国际服务器中快速进行文字交流,消除语言障碍。玩家在游戏中选中...
阅读原文

StochSync

StochSync(Stochastic Diffusion Synchronization)是创新的图像生成技术,专门用于在复杂空间(如360°全景图或3D表面纹理)中生成高质量图像。结合了扩散同...
阅读原文

EliGen

EliGen是浙江大学和阿里巴巴集团联合开发的新型的实体级可控图像生成框架,通过引入区域注意力机制,无需额外参数即可将实体提示和任意形状的空间掩码无缝集...
阅读原文

Hibiki

Hibiki是Kyutai Labs开源的用在同时语音翻译的解码器模型,能实时将一种语言的语音翻译成另一种语言的语音或文本。Hibiki基于多流语言模型架构,同步处理源语...
阅读原文

AlphaGeometry2

AlphaGeometry2 是谷歌 DeepMind 推出的先进的人工智能系统,专门用于解决国际数学奥林匹克竞赛(IMO)中的几何问题。结合了神经符号方法,将谷歌 Gemini 系...
阅读原文
11718192021175