Gemini Embedding

Gemini Embedding 是 Google 推出的先进的文本嵌入模型,基于将文本转化为高维数值向量,捕捉其语义和上下文信息。Gemini Embedding基于 Gemini 模型训练,具...
阅读原文

DoraCycle

DoraCycle 是新加坡国立大学 Show Lab 推出多模态领域适应的统一生成模型,通过两个多模态循环(text-to-image-to-text 和 image-to-text-to-image)实现不同...
阅读原文

Character-3

Character-3 是 Hedra Studio 推出的全模态 AI 数字人视频生成模型,能同时处理图像、文本和音频输入,通过联合推理生成高质量的视频。支持全身动作捕捉和情...
阅读原文

Nanobrowser

Nanobrowser 是开源的 Chrome 扩展工具,专注于 AI 驱动的网页自动化。Nanobrowser基于多智能体系统实现复杂的网页任务,如信息提取、自动化操作等。用户用自...
阅读原文

DINO-XSeek

DINO-XSeek 是 IDEA 研究院推出的多模态目标检测模型,结合视觉感知和自然语言理解能力。DINO-XSeek基于复杂的语言描述精准定位图像中的目标,识别目标的属性...
阅读原文

AppAgentX

AppAgentX 是西湖大学推出的新型自我进化式 GUI(图形用户界面)代理框架,基于从执行历史中抽象出高级动作提升代理在智能手机交互中的效率和智能性。AppAgen...
阅读原文

Cardamon

Cardamon 是 Y Combinator 推出 AI 驱动的合规平台,专为受监管的金融机构设计,通过自动化法规映射帮助企业快速实现合规。基于人工智能技术,将复杂的法规文...
阅读原文

Chikka.ai

Chikka.ai 是专注于客户访谈的AI平台,基于AI语音代理Ava,与受访者进行自然对话,快速收集分析语音反馈。Chikka.ai支持多语言访谈,能同时进行数百次对话,...
阅读原文

URO-Bench

URO-Bench 是面向端到端语音对话模型(SDMs)的全面基准测试工具。涵盖了多语言、多轮对话、副语言信息等多维度任务,全面评估语音对话模型的性能。

Wan

Wan是阿里推出的AI创意平台,平台搭载Wan2.1模型生成能力,专注于AI绘画和AI视频创作。AI绘画基于文字描述,快速生成具有艺术感的图像。AI视频支持将文本和图...
阅读原文

Duck.ai

Duck.ai 是 DuckDuckGo 搜索引擎推出的免费私密的 AI 聊天服务,用户无需注册即可使用。通过代理技术隐藏用户 IP 地址,确保聊天内容不会被用于 AI 模型训练...
阅读原文

GCDance

GCDance(Genre-Controlled 3D Full Body Dance Generation Driven by Music)是英国萨里大学和江南大学推出的3D舞蹈生成框架,能根据音乐和文本提示生成符合...
阅读原文

LaWGPT

LaWGPT 是南京大学推出的中文法律大语言模型,基于 LLaMA 模型进行二次预训练,融入大量中文法律知识。专注于法律领域,能理解和生成与法律相关的文本,适用...
阅读原文

OpenManus

OpenManus 是MetaGPT 团队推出的开源复刻版 Manus,提供无需邀请码的 AI Agent 。OpenManus基于模块化设计,支持多种语言模型和工具链,能执行代码、处理文件...
阅读原文

NEXUS-O

NEXUS-O 是HiThink 研究院、英国帝国理工学院、浙江大学、复旦大学、微软、Meta AI等机构推出的多模态AI模型,能实现对语言、音频和视觉信息的全方位感知与交...
阅读原文