AI工具

微软开源的多功能、多格式文档转Markdown工具

MarkItDown是微软开源的多功能文档处理工具,能将PDF、PPT、Word、Excel、图像、音频、HTML等多种格式的文件转换成Markdown格式。支持OCR文字识别、语音转文...
阅读原文

豆包推出视觉理解模型,具备识别和推理能力

豆包视觉理解模型是豆包推出的先进AI大模型,具备视觉识别和理解推理能力。豆包视觉理解模型能识别图像中物体的类别、形状、纹理等,还能理解物体间的关系和...
阅读原文

豆包推出3D生成模型,自然语言交互实时生成3D场景图

豆包3D生成模型是豆包推出的3D生成模型,属于豆包大模型家族。模型基于3D-DiT 架构,能生成高质量 3D 模块。与火山引擎数字孪生平台 veOmniverse 结合使用,...
阅读原文

MV-Adapter:多视图一致图像生成模型的创新应用与技术优势

MV-Adapter是多视图一致图像生成模型,是北京航空航天大学、VAST和上海交通大学的研究团队推出的。MV-Adapter能将预训练的文本到图像扩散模型转化为多视图图...
阅读原文

谷歌推出的评估大模型能力的基准测试

FACTS Grounding是谷歌DeepMind推出的评估大型语言模型(LLMs)能力的基准测试,衡量模型根据给定上下文生成事实准确且无捏造信息的文本的能力。FACTS Ground...
阅读原文

Databricks SQL:智能数据仓库助力企业高效数据处理与分析

Databricks SQL 是 Databricks 推出的智能数据仓库服务,基于 DatabricksIQ(Data Intelligence Engine)理解用户数据的独特性,为技术与业务用户提供易用的...
阅读原文

开源漫画图片文字翻译工具,多语言翻译无缝嵌入原图

Manga Image Translator是开源的漫画图片文字翻译工具,能一键翻译漫画和图片中的文字。Manga Image Translator基于OCR技术识别文本,结合机器翻译将文字转换...
阅读原文

AI试卷识别处理软件,具备高清扫描、手写擦除、试卷还原等功能

拍试卷是为学生和教师设计的试卷扫描和处理软件。拍试卷基于OCR(光学字符识别)技术,从图片中提取文字变得快速和准确,保持原有的排版格式。拍试卷具备高清...
阅读原文

AI Safeguard联合卡内基梅隆和斯坦福开源的轻量级多模态模型

Ivy-VL是AI Safeguard联合卡内基梅隆大学和斯坦福大学推出的轻量级多模态AI模型,专为移动端和边缘设备设计。模型拥有3B参数量,相较于其他多模态大模型,显...
阅读原文

清华和腾讯共同推出的图像序列着色模型

ColorFlow是清华大学和腾讯ARC实验室共同推出的图像序列着色模型,能精细化地保持图像序列中个体身份的同时进行着色。基于检索增强、上下文学习和超分辨率技...
阅读原文

集成多种社交媒体和通讯渠道的 AI 自动化客户管理工具

Superchat是企业级全渠道消息服务平台,帮助企业整合WhatsApp、Instagram、Facebook Messenger 等渠道建立忠实的客户关系、自动化发送新闻通讯、销售产品并回...
阅读原文

AI全栈开发平台,自然对话快速构建网站和Web应用

Lovable 是AI全栈工程师工具,基于自然语言处理技术,让用户能用对话快速构建网站和Web应用程序。Lovable 平台支持与Supabase集成,实现数据库连接和用户认证...
阅读原文

Midjourney联合Spellbrush推出的二次元AI绘画工具

nijijourney - Midjourney和Spellbrush合作推出的二次元AI绘画工具,支持多种语言
阅读原文

AI工作流可视化构建器,拖放节点设计复杂工作流

NodeTool是开源的AI工作流可视化构建器。NodeTool集成广泛的AI工具和模型,基于简单、可视化的界面,让用户无需编码即可快速原型设计和测试。NodeTool支持在...
阅读原文

中科院联合多所高校机构推出增强多模态音乐生成的框架

VMB(Visuals Music Bridge)是中国科学院信息工程研究所、中国科学院大学网络空间安全学院、上海人工智能实验室、上海交通大学等机构推出的多模态音乐生成框...
阅读原文