OpenAI版Her登场,GPT能实时视频通话了!德扑AI之父:比 o1“更受宠”的模式降临

今天,OpenAI就带来了高级语音模式的功能更新:实时视频通话、屏幕共享和图像上传。
阅读原文

星流AI:全新一站式AI图像生成平台助力创意无限探索

星流AI是LiblibAI推出的一站式AI图像生成平台,基于自研的Star-3通用图像生成模型,结合全球最大的LoRA增强模型库和先进的AI图像控制技术。为设计师、摄影师...
阅读原文

Ultravox:智能多模态助手实现文本与语音的无缝理解

Ultravox是新型的多模态大型语言模型(LLM),能直接理解文本和人类语音,无需依赖单独的自动语音识别(ASR)阶段。基于多模态投影器技术将音频数据转换为高...
阅读原文

谷歌推出的浏览网站智能体,能帮用户操作表格、在线购物

Project Mariner 是谷歌 DeepMind 推出的浏览器助手。Project Mariner基于 Gemini 2.0 技术,用 Chrome 扩展程序实现浏览器自动化,理解和执行网页任务。Proj...
阅读原文

Midjourney 推出的多人协作 AI 虚拟世界构建工具

Patchwork 是 Midjourney 推出的创新性多人协作世界构建工具,支持用户在一个无限的画布上共同创作和构建虚拟世界。结合了AI图像生成技术和实时协作功能,支...
阅读原文

开源的实时多模态 AI 代理框架

TEN Agent是集成OpenAI Realtime API和RTC技术的开源实时多模态AI代理框架。TEN Agent能实现语音、文本、图像的多模态交互,支持高性能的实时通信,具备低延...
阅读原文

FLOAT:音频驱动的流匹配技术实现动态说话人头像生成

FLOAT是DeepBrain AI 和韩国先进科技研究院推出的音频驱动说话人头像生成模型,基于流匹配生成模型,学习运动潜在空间实现高效的时间一致性运动设计。模型基...
阅读原文

AI绘画工具,支持多种场景多种绘画风格和技巧

AISEO Art是AI驱动的艺术生成平台,基于先进的AI技术,支持用户用文本提示创作出独特的视觉艺术作品。平台提供广告产品制作、图像变化、AI头像和滤镜选择等功...
阅读原文

国产之光-豆包AI,吊打Kimi

原标题:国产之光-豆包AI,吊打Kimi 文章来源:卧龙说 内容字数:2310字豆包AI:在AI大战中的崛起 在过去的一年多里,AI领域的竞争愈演愈烈,各种新技术、新...
阅读原文

谷歌发布Geimini2.0,开启Agent新时代

谷歌抛出王炸杀手锏,先人一步开启Agent新时代。
阅读原文

颠覆智能助手:Gemini 2.0 引领全新Agent时代的!

谷歌抛出王炸杀手锏,先人一步开启Agent新时代。
阅读原文